Visão geral: o que a IA faz e o que ela não faz#
Você vai ligar a IA e precisa decidir onde escrever cada coisa. Essa decisão parece de arrumação, mas não é: escrever no lugar errado é o que faz a conta subir e a resposta piorar — as duas ao mesmo tempo.
As quatro camadas de uma resposta#
Quando a mensagem do cliente chega, ela desce por quatro camadas, na ordem configurada em cada agente (o padrão é a IA primeiro):
mensagem do cliente
│
├─ 1. Atendente IA modelo externo, ancorado na base → custa token
│ não conseguiu se ancorar? passa adiante
│
├─ 2. Intenções (NLP) treinadas, rodam LOCAL → token zero
│ confiança abaixo de 0,40? passa adiante
│
├─ 3. Base de conhecimento por similaridade, LOCAL → token zero
│ confiança abaixo de 0,70? passa adiante
│
└─ 4. Fallback a mensagem de "não entendi" → token zero
Duas dessas camadas rodam na sua máquina e não custam nada por mensagem. Só a primeira consome tokens.
Os quatro lugares onde você põe informação#
Eles não são intercambiáveis, e a confusão entre os dois primeiros é a mais cara:
| Lugar | O que é | Onde fica |
|---|---|---|
| Cérebro / persona | Tom, estilo, como se comportar | Agentes → o agente → Cérebro |
| Limites de atuação | O que resolve e o que não faz | Agentes → o agente → Limites |
| Base de conhecimento | Os fatos: procedimento, preço, política | Gerenciamento de Conhecimento |
| Fluxos | Passo a passo determinístico, com integração | Fluxos de comunicação |
O cérebro não é onde vai o conteúdo. O cérebro diz como falar. O conteúdo vai na base.
Por que isso muda o custo#
A cada mensagem, o prompt é remontado e enviado inteiro ao modelo:
| Bloco | Vai em toda mensagem? | Tamanho |
|---|---|---|
| Persona (cérebro) | Sim, inteira | O que você escrever |
| Limites de atuação | Sim, inteiros | O que você escrever |
| Variáveis do atendimento | Sim | Pequeno e fixo |
| Lista de fluxos disponíveis | Sim (só nome e descrição) | Pequeno |
| Base de conhecimento | Só os trechos que casaram | No máximo 6 × 1.200 caracteres |
| Histórico da conversa | Recortado por orçamento | 1.500 tokens por padrão |
A linha da base é a que surpreende: ela não é enviada inteira. A cada mensagem, o sistema faz busca semântica e manda no máximo 6 trechos de 1.200 caracteres. Você pode ter 500 entradas cadastradas que o custo por mensagem não muda.
A persona, não. Ela vai inteira, sempre. Cada caractere escrito ali é pago em toda mensagem de toda conversa, para sempre.
Regra de bolso: conteúdo que serve para algumas perguntas vai na base. Instrução que vale para todas as perguntas vai na persona.
O critério, em uma frase#
Se a informação muda a resposta de uma pergunta específica, ela é conhecimento. Se ela muda o jeito de responder todas, ela é persona.
O que a IA não faz#
Ela não inventa fato quando bem configurada — ela desiste. Quando não consegue se ancorar na base, deixa a mensagem passar para a camada seguinte. É de propósito: um sistema que responde menos é melhor que um que responde errado.
Ela não substitui fluxo. Procedimento determinístico com integração — consultar o ERP, gerar boleto, mandar o PDF — sai mais barato e mais confiável como fluxo do que pedindo à IA para improvisar. Veja O que é um fluxo e quando usar em vez de agente.
Sem chave de provedor configurada, ela não redige. Os fluxos, as intenções e a base continuam funcionando, porque são determinísticos. O sistema responde menos, e não responde errado.
Como fazer#
- Configure o provedor externo — veja Configurar o provedor externo.
- Alimente a base de conhecimento com os fatos. É o passo que mais melhora a resposta.
- Crie o agente com uma persona curta, e escreva os limites no campo próprio.
- Treine as intenções das perguntas mais frequentes: elas passam a ser respondidas localmente, sem custo.
- Acompanhe as Perguntas sem resposta e transforme cada uma em entrada da base.
Se algo der errado#
A IA responde coisas que não existem. Quase sempre o fato está na persona em vez da base, ou não está em lugar nenhum. Conteúdo vai na base, e só na base.
A conta veio alta. Meça o tamanho da persona. É a única parte que cresce o custo de toda mensagem.
A IA não responde nada. Confira se há chave configurada. Sem chave, não há geração — por desenho.
A resposta certa existe na base e ela não usa. Veja Perguntas sem resposta e Raio-X das respostas, que mostra quais trechos foram lidos.