Calculadora de Janela de Contexto

Quanto conteúdo cabe em cada modelo de IA? Compare a capacidade em palavras, páginas, e-mails e mais.

ModeloTokensPalavrasPáginas (A4)E-mailsArquivos de códigoPáginas de PDFLivros (média)
GPT-5.6 Sol
OpenAI
1,050,000807,6922,1005,2508752,62511
GPT-5.6 Terra
OpenAI
1,050,000807,6922,1005,2508752,62511
GPT-5.6 Luna
OpenAI
1,050,000807,6922,1005,2508752,62511
Gemini 2.5 Pro
Google
1,000,000769,2302,0005,0008332,50011
Gemini 2.5 Flash
Google
1,000,000769,2302,0005,0008332,50011
GLM-5.2
Z.ai
1,000,000769,2302,0005,0008332,50011
Kimi K3
Moonshot AI
1,000,000769,2302,0005,0008332,50011
Nemotron 3 Ultra
NVIDIA
1,000,000769,2302,0005,0008332,50011
Llama 4 Maverick
Meta
1,000,000769,2302,0005,0008332,50011
Claude Opus 4.8
Anthropic
200,000153,8464001,0001665002
Claude Sonnet 5
Anthropic
200,000153,8464001,0001665002
Claude Haiku 4.5
Anthropic
200,000153,8464001,0001665002

Apenas estimativas. A contagem real de tokens varia de acordo com o idioma, a formatação e o tipo de conteúdo.

O que a janela de contexto realmente significa

A janela de contexto de um modelo é o número máximo de tokens que ele consegue considerar de uma vez, somando toda a conversa — prompt de sistema, histórico do chat e a entrada atual entram nessa conta. Esta tabela converte o limite bruto de tokens de cada modelo em unidades mais intuitivas: quantas palavras, páginas A4 padrão, e-mails, arquivos de código-fonte ou livros médios caberiam nessa janela. É uma checagem útil antes de montar um fluxo baseado em colar um documento inteiro — alguns documentos simplesmente não cabem, mesmo nas maiores janelas de contexto disponíveis hoje.

O que 128k, 200k e 1M significam na prática

A tabela acima converte limites de tokens em unidades familiares, mas a conversão mais importante é em dinheiro e comportamento. Uma janela de 128k comporta mais ou menos um romance inteiro; enchê-la por completo num modelo premium custa dinheiro de verdade em cada requisição — a US$ 2,50 por milhão de tokens de entrada, uma requisição de 128k cheios sai por uns 32 centavos de dólar, o que em dez mil requisições mensais vira milhares de dólares. Janela grande é capacidade, não armazenamento grátis.

A capacidade útil também é menor que o número da propaganda: a janela é dividida entre system prompt, histórico da conversa, sua entrada e o espaço reservado para a resposta do modelo. Uma aplicação que deixa o histórico crescer sem controle bate no teto — ou no orçamento — muito antes de qualquer documento.

Perdido no meio: por que entupir a janela sai pela culatra

A pesquisa sobre contexto longo encontra sempre o mesmo padrão: os modelos lembram muito melhor da informação perto do início e do fim do contexto do que do material enterrado no meio. Entupir a janela com tudo o que você tem não só custa mais — pode piorar as respostas, porque o trecho relevante disputa atenção com milhares de irrelevantes.

Dois hábitos práticos decorrem disso. Coloque as instruções no início e os fatos mais decisivos perto do fim do prompt. E quando o material de origem é grande, retrieval — indexar o conteúdo e enviar só os trechos que importam — costuma vencer o entupimento de janela em qualidade e em custo. Trate a janela como teto, não como meta.

Casando o tamanho da janela com a carga de trabalho

Chat de turnos curtos e classificação vivem bem em janelas pequenas; perguntas sobre documentos longos e análise de bases de código se beneficiam de 200k para cima; o tier de um milhão de tokens se paga quando repositórios ou coleções inteiras de documentos precisam ser raciocinados numa passada só. Veja a que os seus documentos correspondem no guia de páginas por contexto e meça seus prompts reais na calculadora de tokens antes de assumir que precisa da maior janela do cardápio.

Janelas de contexto no catálogo atual

O tamanho da janela é a primeira restrição a checar e a mais fácil de errar, porque os números de manchete não são comparáveis entre si na prática. Em agosto de 2026, GPT-5.6 Sol, Terra e Luna têm janela de 1,05M tokens. Gemini 2.5 Pro e Flash, GLM-5.2, Kimi K3, Nemotron 3 Ultra e Llama 4 Maverick ficam em 1M. A família Claude — Opus 4.8, Sonnet 5 e Haiku 4.5 — para em 200k, cerca de um quinto dos demais.

O preço muda a conta. Encher uma janela de 1M tokens uma vez custa US$ 5,00 no Sol, US$ 0,20 no Luna (contra US$ 1,00 antes da reprecificação de 30 de julho), US$ 1,25 no Gemini 2.5 Pro (com prompts acima de 200k cobrados na faixa mais cara, de US$ 2,50) e US$ 0,20 no Llama 4 Maverick. Encher os 200k do Claude no Opus 4.8 custa US$ 1,00. Ou seja: os modelos baratos por token são justamente aqueles em que a janela grande é viável de usar de verdade, enquanto um prompt de um milhão de tokens num tier de topo é uma escolha deliberada e cara, não um padrão.

Depois de saber o que cabe, precifique na calculadora da OpenAI ou do Claude.

O que cabe na prática: quatro casos trabalhados

Um contrato de 40 páginas dá cerca de 20.000 tokens. Cabe folgado em todos os modelos aqui, inclusive nos 200k do Claude, com espaço para instruções e uma resposta longa. É o caso ordinário, e o tamanho da janela simplesmente não é a restrição.

Um manual técnico de 300 páginas gira em torno de 200.000 tokens. Isso é a janela inteira do Claude sem sobrar nada para a pergunta nem para a resposta, então na prática você precisa recuperar os capítulos relevantes em vez de colar o livro. Num modelo de 1M cabe com sobra — e custa US$ 1,00 no GPT-5.6 Sol só para ler uma vez.

Uma conversa de suporte de 20 turnos com prompt de sistema de 1.500 tokens chega ao fim com uns 15.000 a 25.000 tokens, porque cada turno reenvia todo o histórico. Barato por chamada, mas acumula em milhares de sessões.

Uma base de código média, digamos 50 mil linhas, fica perto de 600.000 tokens — cabe numa janela de 1M no papel, mas recuperação quase sempre ganha de colar tudo, tanto em custo quanto em acerto. O guia do que realmente cabe desenvolve mais casos.

Perguntas frequentes

Uma janela de contexto maior significa respostas melhores?

Não automaticamente. A maioria dos modelos apresenta alguma perda de precisão e raciocínio conforme se aproxima do limite de contexto. Uma janela maior permite caber mais conteúdo, mas abordagens baseadas em recuperação (retrieval) costumam superar a estratégia de 'colar tudo' em documentos muito grandes.

A janela de contexto inclui a resposta do modelo?

Na maioria dos provedores, sim — a janela de contexto é compartilhada entre sua entrada e a resposta do modelo. Se o seu prompt usa a maior parte da janela, sobra pouco espaço para o modelo gerar uma resposta.

Por que essas estimativas de página e palavra parecem aproximadas?

A tokenização depende do texto específico — escrita técnica densa, código e idiomas diferentes se tokenizam de formas diferentes. Essas conversões usam médias razoáveis para você comparar modelos rapidamente; para um documento específico, use a calculadora de tokens acima.

Pago pela janela inteira ou só pelo que envio?

Só pelos tokens efetivamente enviados e gerados. Janela ociosa não custa nada — o risco é comportamental, porque janela maior convida prompts maiores, e cada token enviado é cobrado na tarifa de entrada em toda requisição que o inclui.

Entrada e saída dividem a mesma janela?

Na maioria dos modelos sim — a janela de contexto é um orçamento compartilhado entre tudo que você envia e tudo que o modelo gera, então uma janela de 200k preenchida com 199k tokens de entrada quase não deixa espaço para responder. Alguns provedores publicam ainda um limite separado de saída. Sempre deixe folga para a resposta, mais uma margem para os tokens de raciocínio que o modelo possa produzir antes de responder.

Janela maior é sempre melhor?

Não, por três motivos. A recuperação de informação piora no meio de prompts muito longos, então o que fica enterrado ali tem mais chance de ser ignorado. A latência sobe com o tamanho do prompt, porque todo o contexto é processado a cada chamada. E você paga por cada token enviado, em cada chamada — janela grande usada sem critério é um dos jeitos mais rápidos de inflar a fatura. Recuperação normalmente ganha de entupir a janela.

O modelo lembra de alguma coisa entre chamadas?

Não por conta própria. A API é stateless: cada requisição carrega o próprio contexto, e o modelo não tem memória das anteriores a menos que a sua aplicação reenvie o histórico. É exatamente por isso que conversas de vários turnos ficam mais caras conforme avançam — você repaga pelas mesmas mensagens antigas a cada turno. Resumir os turnos mais velhos é a solução padrão.

Quer saber de onde vêm estes números? Leia nossa metodologia de preços.