Calculadora de Custo de Resumo de PDF
Quanto custa resumir um PDF longo com IA? Insira o número de páginas e descubra.
Resumir 1 PDF de 300 páginas cada custa a partir de R$ 0,1797 com Llama 4 Maverick.
| Model | Por PDF | Monthly Total |
|---|---|---|
| melhorLlama 4 Maverick | R$ 0,1797 | R$ 0,1797 |
| GPT-5.6 Luna | R$ 0,2273 | R$ 0,2273 |
| Gemini 2.5 Flash | R$ 0,3965 | R$ 0,3965 |
| Nemotron 3 Ultra | R$ 0,5049 | R$ 0,5049 |
| Claude Haiku 4.5 | R$ 1,06 | R$ 1,06 |
| GLM-5.2 | R$ 1,27 | R$ 1,27 |
| Gemini 2.5 Pro | R$ 1,62 | R$ 1,62 |
| GPT-5.6 Terra | R$ 2,27 | R$ 2,27 |
| Claude Sonnet 5 | R$ 3,17 | R$ 3,17 |
| Kimi K3 | R$ 3,17 | R$ 3,17 |
| Claude Opus 4.8 | R$ 5,29 | R$ 5,29 |
| GPT-5.6 Sol | R$ 5,68 | R$ 5,68 |
Estimativa baseada em 400 tokens/página e um resumo de ~12% do tamanho original. PDFs escaneados que exigem OCR usarão mais tokens.
Como o custo de resumo de PDF é calculado
Resumir um PDF com um modelo de IA custa nas duas pontas: você paga pelos tokens de entrada que o modelo lê (basicamente o texto completo do documento) e pelos tokens de saída que ele escreve (o resumo em si). Esta calculadora estima o tamanho de entrada usando uma média de tokens por página de PDF com texto denso, e assume que o resumo de saída é uma porcentagem desse tamanho — as duas premissas aparecem no aviso abaixo do resultado. Multiplique esse custo por PDF pela quantidade de PDFs que você planeja processar para chegar a uma estimativa mensal.
A matemática de resumir um documento longo
Resumo tem um perfil de custo incomum: quase todo o dinheiro vai para a leitura, não para a escrita. Um PDF denso de 300 páginas fica na casa dos 150.000 tokens de entrada, enquanto um resumo executivo caprichado tem 3.000-8.000 tokens de saída — o lado da entrada pesa vinte vezes mais, ou além. Isso inverte o conselho usual: para cargas de resumo, a tarifa de entrada é o número a garimpar, e um modelo com entrada barata e saída mediana pode vencer um com o perfil oposto.
Pipelines reais ainda carregam um overhead que a estimativa ingênua não vê. Documentos maiores que a janela do modelo são divididos em blocos com bordas sobrepostas, e pipelines estilo map-reduce geram resumos intermediários que são cobrados como entrada nova na passada seguinte. Conforme o tamanho e a sobreposição dos blocos, espere 10-30% mais tokens do que o tamanho bruto do documento sugere.
Passada única, blocos ou batch: três estratégias
Se o documento inteiro cabe na janela de contexto, a passada única é a mais simples e normalmente a mais barata por documento — sem overhead de sobreposição, sem resumos intermediários. A fraqueza é a qualidade em entradas muito longas, em que os modelos tendem a subestimar o material enterrado no meio.
O map-reduce em blocos funciona com qualquer modelo, independentemente da janela, e costuma cobrir melhor as seções do documento — ao preço do overhead de tokens descrito acima. E quando você tem muitos documentos em vez de um só muito grande, o batch é a alavanca que importa: os dois grandes provedores rodam jobs assíncronos por cerca de metade do preço, o que num pipeline noturno de milhares de PDFs é a diferença entre duas faturas de tamanhos bem diferentes.
Cortando o custo de resumo em escala
Limpe antes de enviar: cabeçalhos, rodapés, números de página, avisos repetidos e artefatos de OCR são cobrados como conteúdo, mas não acrescentam nada ao resumo. Se os usuários fazem perguntas sobre o documento em vez de querer um resumo completo, retrieval costuma vencer o resumo — indexar o documento e enviar só os trechos relevantes pode cortar a entrada em uma ordem de grandeza.
Antes de fechar um pipeline, confira se os seus documentos sequer cabem numa requisição no guia de páginas por contexto e precifique a rodada completa na calculadora de custos da OpenAI com as suas contagens reais de páginas.
O mesmo PDF de 100 páginas, precificado em cada modelo
Resumo é uma carga pesada de entrada, então a tarifa de entrada domina e o ranking dos modelos fica diferente do de uma carga de chat. Pegue um documento de 100 páginas a cerca de 400 tokens por página: 40.000 tokens de entrada, mais um resumo de 1.500 tokens na saída. Nos preços de tabela de agosto de 2026, uma passada custa aproximadamente US$ 0,245 no GPT-5.6 Sol (US$ 5,00 / US$ 30,00 por milhão), US$ 0,238 no Claude Opus 4.8 (US$ 5,00 / US$ 25,00), US$ 0,098 no GPT-5.6 Terra (US$ 2,00 / US$ 12,00) e US$ 0,143 no Claude Sonnet 5 (US$ 3,00 / US$ 15,00).
Mais abaixo: US$ 0,048 no Claude Haiku 4.5 (US$ 1,00 / US$ 5,00), US$ 0,066 no GLM-5.2 (US$ 1,40 / US$ 4,40), US$ 0,024 no Gemini 2.5 Flash (US$ 0,30 / US$ 2,50), US$ 0,0098 no GPT-5.6 Luna (US$ 0,20 / US$ 1,20) e US$ 0,0089 no Llama 4 Maverick (US$ 0,20 / US$ 0,60). A reprecificação de 30 de julho colocou o Luna a um erro de arredondamento do Maverick nesta carga — porque a entrada domina, e os dois passaram a dividir a mesma tarifa de US$ 0,20.
Um documento é troco em qualquer um deles. A escolha só passa a importar no volume: 10 mil documentos por mês custam cerca de US$ 2.450 no Sol, US$ 98 no Luna e US$ 89 no Maverick. Rode os números para as suas contagens de página acima, e veja a análise completa de custo para a estratégia por trás da escolha de modelo.
Perguntas frequentes
Isso considera PDFs escaneados ou baseados em imagem?
Não diretamente. PDFs escaneados geralmente precisam de OCR antes que um modelo de IA consiga lê-los, o que adiciona um custo separado de OCR ou aumenta a contagem de tokens se você enviar as imagens diretamente para um modelo com visão. Trate a estimativa aqui como um piso para documentos escaneados.
Por que o número de páginas importa mais que o de palavras?
PDFs variam muito em densidade — uma página de tabelas financeiras densas se tokeniza de forma bem diferente de uma página de texto espaçado. Usamos uma média de tokens por página como aproximação prática; para um documento específico, rode uma amostra na calculadora de tokens acima.
Como reduzir o custo de resumir muitos PDFs?
Agrupar requisições onde o provedor oferece desconto para processamento assíncrono, usar um modelo mais barato para um primeiro resumo, e reaproveitar (cache) trechos repetidos como cabeçalhos e avisos entre documentos são as formas mais comuns de reduzir esse custo em escala.
Sai mais barato resumir em etapas — um resumo de resumos?
Para documentos além da janela de contexto, muitas vezes é a única opção, e de fato limita o custo por requisição. Mas cada etapa perde detalhe, e os resumos intermediários são cobrados como entrada nova. Se você precisa de alta fidelidade, poucas passadas grandes num modelo de contexto longo costumam vencer muitas etapas pequenas.
Como estimar os tokens de um PDF antes de enviar?
Extraia o texto e cole uma amostra representativa na [calculadora de tokens](/pt/token-calculator), depois multiplique pelo número de páginas. Texto denso fica em torno de 500 tokens por página, mas slides podem dar um quinto disso e texto jurídico passa bem disso.
Quão precisa é a conta de 400 tokens por página?
É uma estimativa intencionalmente central, para páginas de prosa comum. Uma página esparsa, com títulos e espaço em branco, pode ficar perto de 250 tokens; uma página acadêmica densa, com notas de rodapé e tabelas, pode passar de 600. PDFs escaneados passados por OCR são ainda mais ruidosos e costumam custar mais. Use 400 para planejar e depois meça uma amostra representativa dos seus documentos na calculadora de tokens antes de fechar um orçamento de volume.
Imagens e gráficos no PDF custam à parte?
Se você os envia para um modelo com visão, sim — imagens são cobradas como tokens adicionais de entrada, precificados por resolução, e uma única figura de página inteira pode custar o equivalente a várias páginas de texto. Se o seu pipeline extrai só a camada de texto, as imagens não custam nada, mas o conteúdo delas se perde — o que pesa em documentos onde o gráfico carrega o argumento. Decida de qual dos dois você precisa antes de precificar.
Dividir o documento em blocos custa mais que uma passada única?
Normalmente um pouco mais, porque cada bloco reenvia as instruções e cada resumo intermediário volta como entrada na consolidação final — um overhead de uns 10% a 25%, dependendo do tamanho do bloco. Em troca você ganha melhor recuperação em documentos longos e deixa de esbarrar no limite da janela. Num documento de 200 mil tokens, aliás, dividir não é opcional para um modelo de janela de 200k.
Quer saber de onde vêm estes números? Leia nossa metodologia de preços.