Ir para o conteúdo
Cavori
EntrarCriar conta

Como funciona RAG em agentes de IA de atendimento

RAG (retrieval-augmented generation) recupera trechos relevantes de uma base de conhecimento e os entrega ao modelo antes de gerar a resposta. Veja o fluxo passo a passo, onde ele falha e como avaliar a qualidade.

Técnico4 min de leituraPublicado em

RAG (retrieval-augmented generation, ou geração aumentada por recuperação) é a técnica que faz um agente de IA responder com as informações de uma base de conhecimento em vez de depender apenas do que o modelo de linguagem aprendeu no treinamento. Antes de gerar a resposta, o sistema recupera os trechos mais relevantes da base e os entrega ao modelo junto com a pergunta e o histórico da conversa.

Em atendimento, é o mecanismo que faz a diferença entre "um modelo que fala sobre clínicas em geral" e "um agente que sabe os horários, os convênios e as políticas desta clínica".

O fluxo passo a passo

  1. Preparação da base. As informações da empresa (serviços, políticas, perguntas frequentes) são organizadas em documentos e divididas em trechos. Cada trecho recebe uma representação numérica (embedding) que captura o significado do texto, e tudo é guardado em um índice.
  2. Chega a pergunta. O cliente escreve, por exemplo: "vocês parcelam?"
  3. Recuperação. A pergunta recebe o mesmo tipo de representação, e o índice devolve os trechos mais próximos em significado: neste caso, o trecho sobre formas de pagamento, mesmo que a palavra "parcelar" não apareça nele.
  4. Montagem do contexto. O sistema junta as instruções do agente (objetivo, tom, limites), o histórico da conversa, os trechos recuperados e a pergunta.
  5. Geração. O modelo escreve a resposta usando esse contexto. Se a base diz que o parcelamento é em até 3 vezes sem juros, é isso que o agente responde.
  6. Verificação de limites. Se a pergunta sai do escopo ou o cliente pediu uma pessoa, a resposta é substituída pela transferência para a equipe.

Por que isso funciona

Modelos de linguagem são bons em escrever a partir de um contexto e ruins em lembrar fatos específicos de uma empresa que nunca viram. O RAG resolve isso colocando os fatos na frente do modelo no momento certo. Como o modelo não é alterado, a base pode mudar a qualquer momento: atualizou o horário, a próxima resposta já reflete a mudança.

Outra vantagem é a rastreabilidade. Quando uma resposta sai errada, dá para descobrir de qual trecho ela veio e corrigir a fonte, em vez de procurar o problema dentro de um modelo.

Onde o RAG falha

  • A base não tem a informação. O modelo recebe trechos irrelevantes e pode preencher a lacuna com uma suposição. A defesa é instruir o agente a dizer que não sabe e transferir, e monitorar os assuntos sem resposta.
  • A base tem informação contraditória. Dois trechos com horários diferentes produzem respostas inconsistentes. Uma base limpa vale mais que uma base grande.
  • A recuperação traz o trecho errado. Perguntas ambíguas ou muito curtas podem puxar conteúdo parecido, mas não o certo. O histórico da conversa ajuda a desambiguar.
  • Trechos longos demais ou curtos demais. A divisão dos documentos afeta a qualidade. Trechos que carregam uma ideia completa funcionam melhor.

Como avaliar se o RAG está funcionando

Não há como saber sem testar com perguntas reais. O método mais direto é montar um conjunto de perguntas que os clientes fazem, com a resposta esperada, e conferir o agente contra ele. Na Cavori, isso é feito no simulador: as conversas de teste são avaliadas resposta por resposta e salvas como casos, que rodam de novo depois de cada mudança na base ou nas instruções. Depois de publicado, o portal mostra os assuntos que o agente ainda precisa aprender, o que indica onde a base está incompleta.

RAG e fine-tuning não são concorrentes

Fine-tuning ajusta o comportamento do modelo com exemplos; RAG fornece informação no momento da resposta. Para atendimento, RAG resolve a parte dos fatos; fine-tuning, quando usado, resolve estilo e formato. A comparação está em RAG vs fine-tuning para atendimento.

Como a Cavori usa RAG

Cada empresa tem uma base de conhecimento própria no seu espaço, com apresentação do negócio, serviços, informações de atendimento e perguntas frequentes. O agente consulta só essa base. Para agências que operam vários clientes, isso garante que o agente de um cliente nunca responda com o conhecimento de outro. A página RAG para atendimento resume o funcionamento, e como construir uma base de conhecimento mostra o que incluir.

Crie um agente de IA e teste antes de publicar.

Na Cavori você descreve o atendimento, monta a base de conhecimento, testa no simulador e publica no WhatsApp com a equipe no controle.

Criar conta