Preço por token e como ler o painel de consumo#
A IA cobra por token — pedaços de texto que entram e saem do modelo. O painel de consumo mostra quanto foi gasto, e esta página explica como ler esse número e, principalmente, o que muda quando ele está alto.
O que é cobrado#
Cada mensagem respondida pela IA gasta tokens de entrada (tudo que é mandado ao modelo) e de saída (o que ele responde). A entrada costuma ser muito maior que a saída, e é onde está a economia.
O que vai na entrada, a cada mensagem:
| Bloco | Vai sempre? | Tamanho |
|---|---|---|
| Persona (cérebro do agente) | Sim, inteira | O que você escrever |
| Limites de atuação | Sim, inteiros | O que você escrever |
| Variáveis do atendimento | Sim | Pequeno e fixo |
| Lista de fluxos e agentes | Sim (nome e descrição) | Pequeno |
| Base de conhecimento | Só os trechos que casaram | Teto de 6 × 1.200 caracteres |
| Histórico da conversa | Recortado por orçamento | 1.500 tokens por padrão |
A conta que muda a decisão#
Este é o levantamento feito com o estimador do próprio sistema, para um setor de suporte com oito assuntos:
| Cenário | Persona e blocos | Bloco da base | Total por mensagem |
|---|---|---|---|
| A) Tudo escrito na persona, base vazia | 5.889 | 0 | 7.389 |
| A2) Tudo escrito na persona e na base | 5.889 | 2.000 | 9.389 |
| B) Persona enxuta, conteúdo na base | 1.000 | 2.000 | 4.500 |
| C) Um agente por área, cada um com sua base | 862 | 2.000 | 4.362 |
Traduzindo em dinheiro, contando só tokens de entrada, ao preço de US$ 0,27 por milhão citado no levantamento:
| Mensagens/mês | Cenário A | Cenário B | Economia |
|---|---|---|---|
| 10.000 | US$ 19,95 | US$ 12,15 | US$ 7,80 |
| 50.000 | US$ 99,75 | US$ 60,75 | US$ 39,00 |
| 200.000 | US$ 399,01 | US$ 243,00 | US$ 156,01 |
O bloco da base é teto fixo de 2.000 tokens. Ele não cresce com o tamanho da base — 20 entradas ou 500, são sempre no máximo 6 trechos de 1.200 caracteres. E, pelo mesmo motivo, ele não encolhe por você dividir em vários agentes: qualquer base com 6 ou mais entradas preenche as 6 vagas.
Por isso o cenário C economiza só 3% sobre o B. Todo o ganho está em tirar o conteúdo da persona — não em multiplicar agentes.
Como fazer#
- Vá em Configurações → Inteligência artificial, painel de consumo.
- Escolha o período.
- Compare o consumo com o número de mensagens atendidas pela IA. O que interessa é o custo por mensagem, não o total: total alto com volume alto é operação crescendo.
- Se o custo por mensagem estiver alto, meça o tamanho da persona dos agentes. É a causa mais comum.
Preenchendo o valor do dólar na configuração do provedor, o consumo também aparece em reais. É uma conversão fixa para leitura gerencial, não o câmbio do dia.
O que o painel não mostra#
Ele só conhece o que passou por ele. O que rodou antes da atualização que passou a registrar consumo não aparece.
Ele mostra o consumo relatado pelo provedor, e há detalhes que não chegam nesse relato: cache de prompt e desconto por volume, por exemplo, podem não aparecer. A fatura do provedor é a verdade final; o painel é a leitura operacional.
Como baixar o custo, em ordem de eficácia#
- Tire o conteúdo da persona e ponha na base. É o maior ganho, com folga.
- Escreva os limites no campo próprio, em vez de dentro do texto da persona — é mais curto e não se perde.
- Treine intenções para as perguntas mais frequentes: elas passam a ser respondidas localmente, sem token.
- Deixe o autoaprendizado trabalhar. Cada pergunta já respondida vira variação na entrada que a ancorou, e a segunda vez tende a ser respondida localmente.
- Considere o RAG local — veja IA local (RAG).
- Baixe o esforço de raciocínio, se estiver alto sem necessidade.
- Só então troque para um modelo mais barato.
Se algo der errado#
O consumo subiu sem o volume subir. Alguém aumentou a persona de um agente, ou trocou o modelo. As duas coisas aparecem assim.
O painel mostra menos do que a fatura do provedor. Pode haver uso da mesma chave por outro sistema. Use uma chave por sistema para conseguir separar.
O painel está vazio. Não houve uso no período, ou o registro de consumo começou depois. Veja a data de início do registro na própria tela.