Pular para o conteúdo
DootCentral de Ajuda Suporte
Índice

Preço por token e como ler o painel de consumo#

A IA cobra por token — pedaços de texto que entram e saem do modelo. O painel de consumo mostra quanto foi gasto, e esta página explica como ler esse número e, principalmente, o que muda quando ele está alto.

O que é cobrado#

Cada mensagem respondida pela IA gasta tokens de entrada (tudo que é mandado ao modelo) e de saída (o que ele responde). A entrada costuma ser muito maior que a saída, e é onde está a economia.

O que vai na entrada, a cada mensagem:

BlocoVai sempre?Tamanho
Persona (cérebro do agente)Sim, inteiraO que você escrever
Limites de atuaçãoSim, inteirosO que você escrever
Variáveis do atendimentoSimPequeno e fixo
Lista de fluxos e agentesSim (nome e descrição)Pequeno
Base de conhecimentoSó os trechos que casaramTeto de 6 × 1.200 caracteres
Histórico da conversaRecortado por orçamento1.500 tokens por padrão

A conta que muda a decisão#

Este é o levantamento feito com o estimador do próprio sistema, para um setor de suporte com oito assuntos:

CenárioPersona e blocosBloco da baseTotal por mensagem
A) Tudo escrito na persona, base vazia5.88907.389
A2) Tudo escrito na persona e na base5.8892.0009.389
B) Persona enxuta, conteúdo na base1.0002.0004.500
C) Um agente por área, cada um com sua base8622.0004.362

Traduzindo em dinheiro, contando só tokens de entrada, ao preço de US$ 0,27 por milhão citado no levantamento:

Mensagens/mêsCenário ACenário BEconomia
10.000US$ 19,95US$ 12,15US$ 7,80
50.000US$ 99,75US$ 60,75US$ 39,00
200.000US$ 399,01US$ 243,00US$ 156,01

O bloco da base é teto fixo de 2.000 tokens. Ele não cresce com o tamanho da base — 20 entradas ou 500, são sempre no máximo 6 trechos de 1.200 caracteres. E, pelo mesmo motivo, ele não encolhe por você dividir em vários agentes: qualquer base com 6 ou mais entradas preenche as 6 vagas.

Por isso o cenário C economiza só 3% sobre o B. Todo o ganho está em tirar o conteúdo da persona — não em multiplicar agentes.

Como fazer#

  1. Vá em Configurações → Inteligência artificial, painel de consumo.
  2. Escolha o período.
  3. Compare o consumo com o número de mensagens atendidas pela IA. O que interessa é o custo por mensagem, não o total: total alto com volume alto é operação crescendo.
  4. Se o custo por mensagem estiver alto, meça o tamanho da persona dos agentes. É a causa mais comum.

Preenchendo o valor do dólar na configuração do provedor, o consumo também aparece em reais. É uma conversão fixa para leitura gerencial, não o câmbio do dia.

O que o painel não mostra#

Ele só conhece o que passou por ele. O que rodou antes da atualização que passou a registrar consumo não aparece.

Ele mostra o consumo relatado pelo provedor, e há detalhes que não chegam nesse relato: cache de prompt e desconto por volume, por exemplo, podem não aparecer. A fatura do provedor é a verdade final; o painel é a leitura operacional.

Como baixar o custo, em ordem de eficácia#

  1. Tire o conteúdo da persona e ponha na base. É o maior ganho, com folga.
  2. Escreva os limites no campo próprio, em vez de dentro do texto da persona — é mais curto e não se perde.
  3. Treine intenções para as perguntas mais frequentes: elas passam a ser respondidas localmente, sem token.
  4. Deixe o autoaprendizado trabalhar. Cada pergunta já respondida vira variação na entrada que a ancorou, e a segunda vez tende a ser respondida localmente.
  5. Considere o RAG local — veja IA local (RAG).
  6. Baixe o esforço de raciocínio, se estiver alto sem necessidade.
  7. Só então troque para um modelo mais barato.

Se algo der errado#

O consumo subiu sem o volume subir. Alguém aumentou a persona de um agente, ou trocou o modelo. As duas coisas aparecem assim.

O painel mostra menos do que a fatura do provedor. Pode haver uso da mesma chave por outro sistema. Use uma chave por sistema para conseguir separar.

O painel está vazio. Não houve uso no período, ou o registro de consumo começou depois. Veja a data de início do registro na própria tela.

Relacionado