O que é token e janela de contexto, e por que a conta da API de IA vem maior do que você calculou
Quase todo estouro de orçamento em projeto de IA tem a mesma origem: alguém calculou o custo de uma pergunta e esqueceu que a conversa inteira viaja junto em todas as outras.
Token é o pedaço de texto que o modelo processa, mais ou menos três quartos de uma palavra em português. Janela de contexto é quanto texto cabe numa única chamada, somando o que você manda e o que ele responde. A conta surpreende porque o modelo não tem memória: a cada nova mensagem, a conversa inteira é reenviada e cobrada de novo, o que faz o custo de uma conversa crescer ao quadrado e não em linha reta.
O que você leva deste artigo
- Um token é cerca de 0,75 palavra em português, e acentuação e nome próprio consomem mais que o esperado.
- A janela de contexto é o teto de uma chamada, não a memória do modelo entre chamadas.
- Custo de conversa cresce ao quadrado: a décima mensagem paga as nove anteriores de novo.
- Saída custa várias vezes mais que entrada, e modelos com raciocínio cobram o rascunho que você não vê.
- Cache de prompt derruba o custo do trecho fixo e é o ajuste de maior retorno em quase todo projeto.
- Teto por usuário e por dia não é detalhe: é o que separa um custo previsível de um prejuízo.
Token: a unidade que a máquina realmente lê
O modelo não lê letras nem palavras. Ele lê tokens, que são pedaços de texto de tamanho variável definidos por um dicionário criado no treinamento. Palavras comuns costumam ser um token inteiro. Palavras raras se quebram em vários. Pontuação, espaço e quebra de linha também contam.
A regra prática mais útil: em português, um token equivale a mais ou menos 0,75 palavra. Mil palavras dão perto de 1.300 tokens. Uma página de texto corrido gira em torno de 600 a 800 tokens. Um contrato de dez páginas passa fácil de 7.000.
Tem uma armadilha específica com o português que quase ninguém considera na hora de orçar. Os dicionários desses modelos foram construídos majoritariamente sobre texto em inglês, então palavra acentuada, nome próprio brasileiro, endereço e termo técnico do nosso mercado tendem a se fragmentar em mais tokens do que o equivalente em inglês. Na prática, o mesmo conteúdo custa mais em português do que custaria em inglês. Não saia daqui com um percentual: meça o seu próprio texto com a ferramenta de contagem do provedor, porque a diferença muda conforme o vocabulário do seu setor.
Some a isso o que não é texto visível: instruções de sistema, descrição de ferramentas disponíveis, formatação JSON, marcação. Tudo isso são tokens, e tudo isso é cobrado toda vez.
Janela de contexto: o teto de uma chamada
Janela de contexto é o total de tokens que cabe numa única chamada, somando tudo que você manda e tudo que o modelo responde. Se a janela é de 200 mil tokens, é isso que precisa caber entre instrução, histórico, documentos anexados e a resposta.
A confusão mais frequente é achar que janela grande significa memória. Não significa. O modelo não guarda nada entre uma chamada e outra: janela grande significa que cabe mais coisa de uma vez, e nada mais. Quem reenvia a conversa a cada mensagem é o programa em volta, não o modelo.
Quando a conversa passa do teto, alguma coisa precisa sair, e é aí que aparece o comportamento que assusta o usuário: o assistente esquece o que foi combinado no começo. Não é falha, é o corte. Ferramentas resolvem isso de formas diferentes, resumindo o começo ou descartando, e cada escolha tem um custo em fidelidade.
Existe ainda um efeito medido e pouco divulgado: modelos costumam prestar mais atenção no começo e no fim do que foi enviado do que no meio. Enfiar um documento gigante na janela e esperar que uma frase perdida na página 40 seja usada é uma aposta pior do que parece. Recortar o trecho relevante e mandar só ele costuma dar resultado melhor e mais barato.
Janela grande não é memória. É só um caminhão maior, que continua sendo carregado do zero em toda viagem.
A conta que surpreende: por que o custo cresce ao quadrado
Aqui está o ponto que estoura orçamento, e ele é simples de demonstrar. Como o modelo não lembra, cada mensagem nova precisa levar junto toda a conversa anterior. Então você não paga uma vez por cada mensagem: você paga a conversa acumulada, de novo, a cada rodada.
Vamos fazer a conta com números redondos e ilustrativos. Suponha um atendimento em que a instrução do sistema tem 1.000 tokens, cada pergunta do usuário tem 100 e cada resposta tem 300. Na primeira rodada entram 1.100 tokens de entrada, os 1.000 da instrução mais os 100 da pergunta, e saem 300. Na segunda, entram os mesmos 1.000 de instrução, mais os 400 que a rodada anterior deixou no histórico, mais os 100 da nova pergunta: 1.500. Na terceira, 1.900. Cada rodada acrescenta 400 fixos, e a décima entra com 4.700.
Somando as dez rodadas, você não processou 11 mil tokens de entrada, processou 29 mil. Quase o triplo do que uma conta ingênua estimaria, e a diferença cresce quanto mais longa for a conversa, porque o histórico entra de novo em toda rodada. Multiplique por mil atendimentos por mês e o erro de estimativa vira o orçamento inteiro.
A segunda surpresa é a assimetria de preço. Nas tabelas públicas dos principais fornecedores, o token de saída custa tipicamente cinco vezes o token de entrada, e em alguns modelos mais que isso. Uma resposta longa custa desproporcionalmente caro, e pedir ao modelo para ser conciso é uma medida de economia, não só de estilo.
O rascunho invisível dos modelos que raciocinam
Modelos com raciocínio produzem um rascunho interno antes de responder. Esse rascunho é gerado, é contado como saída e é cobrado, mesmo quando você não o vê na tela.
Isso cria duas armadilhas práticas em projeto. A primeira é de custo: uma resposta de 200 tokens pode ter custado 2.000 tokens de saída, e a diferença aparece só na fatura, não no que você leu.
A segunda é técnica e derruba integração em produção. Se você define um teto de tokens de saída, o rascunho divide esse teto com a resposta final. Um raciocínio longo pode consumir o limite inteiro e devolver uma resposta vazia ou cortada. O programa que espera um texto recebe nada, e o erro parece aleatório porque só acontece nas perguntas difíceis.
Onde a tarefa é simples e repetitiva, como classificar mensagem ou extrair campo de um documento, o raciocínio profundo não melhora o resultado e multiplica o custo. Reduzir o esforço de raciocínio nesses casos é um dos ajustes de melhor retorno que existem.
Cache de prompt: o ajuste de maior retorno
Em quase todo sistema de IA existe um pedaço fixo que vai em toda chamada: a instrução do sistema, o manual de tom, a lista de produtos, as regras da empresa. Esse bloco não muda e é reenviado milhares de vezes.
O cache de prompt existe exatamente para isso. O provedor guarda o processamento desse trecho fixo por um tempo e cobra a leitura seguinte por uma fração do preço normal de entrada. Gravar no cache custa um pouco mais que uma entrada comum; ler dele custa muito menos.
A regra de ouro é de arquitetura, e ela é o que a maioria erra: o que é fixo tem que vir primeiro e nunca mudar, e o que varia vem depois. Se você coloca a data de hoje ou o nome do cliente no começo da instrução, o trecho fixo muda a cada chamada, o cache nunca acerta e você paga preço cheio sem entender por quê.
Em sistemas com instrução longa e muitas chamadas, esse ajuste sozinho costuma cortar boa parte da conta. É a primeira coisa a olhar quando um projeto de IA fica caro demais, antes de trocar de modelo.
Escolher modelo por tarefa, não por reputação
O erro de custo mais comum em empresa é usar o modelo mais capaz para tudo. Ele é caro, é mais lento e, na maior parte das tarefas de rotina, não entrega resultado melhor.
Uma triagem simples resolve. Classificar mensagem, extrair campo, etiquetar, decidir para qual setor encaminhar: modelo pequeno e barato, com raciocínio no mínimo. Redigir texto que vai para o cliente, analisar documento, resolver problema com várias etapas: modelo capaz. A economia de rodar a rotina no modelo pequeno costuma financiar o uso do modelo caro onde ele importa.
Existe um padrão que funciona bem e é subutilizado: o modelo barato faz a triagem e só escala para o caro quando a tarefa é realmente difícil ou quando a confiança está baixa. A maior parte do volume nunca chega ao modelo caro.
Para comparar capacidade sem depender de propaganda, vale olhar as medições públicas reunidas no AI Benchmark. E antes de trocar de modelo por causa de custo, faça a conta desta página: com frequência o problema não é o preço do modelo, é a arquitetura da chamada.
- Tarefa mecânica e repetitiva: modelo pequeno, raciocínio mínimo, resposta curta.
- Texto que vai para o cliente: modelo capaz, com revisão humana antes do envio.
- Documento longo: recorte o trecho relevante antes de mandar, em vez de enviar tudo.
- Bloco fixo de instrução: sempre no início e sempre igual, para o cache funcionar.
- Conversa longa: resuma o histórico a cada tantas rodadas em vez de arrastar tudo.
Os quatro erros que multiplicam a conta
Primeiro: arrastar a conversa inteira para sempre. A partir de certo ponto, resumir o histórico e mandar o resumo custa uma fração de reenviar tudo, e o resultado piora pouco. Quase nenhum sistema caseiro faz isso.
Segundo: mandar o documento inteiro. Anexar um PDF de 80 páginas para responder uma pergunta que está no parágrafo 3 é pagar 80 páginas por uma. Buscar o trecho certo e mandar só ele é mais barato e dá resposta melhor, porque o modelo não se perde no meio.
Terceiro: não ter teto. Sem limite por usuário, por sessão e por dia, qualquer laço mal fechado ou uso abusivo vira fatura. Isso não é hipótese: um cron mal escrito repetindo chamada é o jeito mais rápido conhecido de gastar em uma noite o orçamento do mês.
Quarto: não medir. Se você não registra tokens de entrada, de saída, de raciocínio e de cache por chamada, você não tem como saber onde o dinheiro foi. Gravar isso numa tabela desde o primeiro dia custa quase nada e é a diferença entre otimizar com dado e otimizar com palpite.
Como orçar um projeto sem se enganar
O método que funciona tem quatro passos e leva uma tarde. Primeiro, escreva uma interação real completa, do jeito que ela vai acontecer, com a instrução de sistema de verdade e não uma versão resumida.
Segundo, conte os tokens dessa interação com a ferramenta de contagem do provedor, não no olho. Terceiro, multiplique pelo número de interações que você espera por mês e some o efeito acumulado da conversa, aquele crescimento ao quadrado da terceira seção. Quarto, e este é o passo que quase todo mundo pula, multiplique o total por três.
O fator três não é pessimismo, é o que a experiência mostra: retentativa quando dá erro, conversa mais longa do que o previsto, gente testando, o rascunho de raciocínio que você esqueceu de contar. Se o projeto só fecha na conta otimista, ele não fecha.
E vale a regra que a ROO3 aplica em produto próprio: preço de venda de qualquer funcionalidade com IA precisa ter margem suficiente para absorver o dobro do custo estimado. Quem vende ilimitado sem teto está apostando que o cliente vai usar pouco. Se você está desenhando um produto assim agora, essa conversa é parte do que a consultoria em IA resolve antes de virar código.
Perguntas frequentes
Quantos tokens tem uma palavra em português?
Em média um token equivale a cerca de 0,75 palavra, então mil palavras dão perto de 1.300 tokens. Textos com muita acentuação, nomes próprios brasileiros e termos técnicos se fragmentam mais e consomem mais tokens que o equivalente em inglês, então vale medir o seu próprio material na ferramenta de contagem do provedor em vez de aplicar um percentual de bolso.
Janela de contexto grande significa que a IA lembra de mim?
Não. A janela é o teto de uma única chamada, não memória entre chamadas. O modelo é recalculado do zero toda vez, e quando parece que ele lembra é porque o programa reenviou a conversa inteira junto com a nova mensagem, pagando por ela outra vez.
Por que minha conta de API veio maior do que eu calculei?
Quase sempre por três motivos somados: a conversa inteira é reenviada a cada mensagem, o que faz o custo crescer ao quadrado; a saída costuma custar cinco vezes mais que a entrada; e modelos com raciocínio cobram o rascunho interno que você não vê na tela.
O que é cache de prompt e vale a pena?
É guardar o processamento do trecho fixo da sua instrução para que as chamadas seguintes o leiam por uma fração do preço. Vale muito em sistemas com instrução longa e muitas chamadas. A condição é que o bloco fixo venha primeiro e não mude, senão o cache nunca acerta.
Devo usar sempre o modelo mais avançado?
Não. Para classificar, extrair e etiquetar, um modelo pequeno entrega o mesmo resultado por uma fração do preço e com menos espera. Reserve o modelo capaz para texto que vai ao cliente e para tarefas com várias etapas de raciocínio.
Como estimo o custo antes de construir?
Escreva uma interação real completa, conte os tokens com a ferramenta do provedor, multiplique pelo volume esperado somando o crescimento acumulado da conversa e depois multiplique o total por três. O fator três cobre retentativa, uso maior que o previsto e o rascunho de raciocínio.
Rodrigo Fávaro
Fundador da ROO3, agência de marketing e tecnologia em São José do Rio Preto. Constrói produtos com IA em produção (Tobia, gerar.app, Pense Mercado) e mantém o AI Benchmark, ranking público de modelos de IA. Veja a consultoria em IA da ROO3.
X @rodmf LinkedIn rodrigofavaroContinue lendo

O que é um LLM: como funciona por dentro e o que ele não faz
O que é um LLM explicado sem matemática: como o modelo prevê a próxima palavra, por que isso funciona tão bem e quais...
12 min de leitura
O que é RAG e por que ele é a forma mais barata de usar IA
O que é RAG explicado de forma prática: como funciona a busca antes da resposta, quando ele resolve, o que ele não...
10 min de leitura
RAG, fine-tuning ou prompt: qual usar em cada caso
Quando usar prompt, quando usar RAG e quando o fine-tuning se justifica de verdade. A pergunta que decide, o custo...
9 min de leituraQuer aplicar isso na sua empresa?
A ROO3 faz o diagnóstico do que dá para automatizar primeiro no seu negócio. A conversa inicial é gratuita.