Calculadora de Custos OpenAI
Estime seus custos mensais de API da OpenAI. Ajuste seu padrão de uso e veja como os modelos GPT se comparam às alternativas.
OpenAI opção mais barata: GPT-5.6 Luna por R$ 71,50/mês — o mais barato no geral é Llama 4 Maverick (R$ 38,50/mês)
Modelos OpenAI
| Model | Por Requisição | Monthly Total |
|---|---|---|
| melhorGPT-5.6 Luna | R$ 0,0072 | R$ 71,50 |
| GPT-5.6 Terra | R$ 0,0715 | R$ 715,00 |
| GPT-5.6 Sol | R$ 0,1788 | R$ 1.787,50 |
Todos os Modelos (Comparação)
| Model | Por Requisição | Monthly Total |
|---|---|---|
| melhorLlama 4 Maverick | R$ 0,0039 | R$ 38,50 |
| GPT-5.6 Luna | R$ 0,0072 | R$ 71,50 |
| Nemotron 3 Ultra | R$ 0,0135 | R$ 134,75 |
| Gemini 2.5 Flash | R$ 0,0146 | R$ 145,75 |
| GLM-5.2 | R$ 0,0281 | R$ 280,50 |
| Claude Haiku 4.5 | R$ 0,0302 | R$ 302,50 |
| Gemini 2.5 Pro | R$ 0,0584 | R$ 584,38 |
| GPT-5.6 Terra | R$ 0,0715 | R$ 715,00 |
| Claude Sonnet 5 | R$ 0,0907 | R$ 907,50 |
| Kimi K3 | R$ 0,0907 | R$ 907,50 |
| Claude Opus 4.8 | R$ 0,1512 | R$ 1.512,50 |
| GPT-5.6 Sol | R$ 0,1788 | R$ 1.787,50 |
Como funciona o preço da API da OpenAI
A OpenAI cobra separadamente por tokens de entrada e de saída, e o valor depende do modelo escolhido. Tokens de entrada são o que você envia à API — seu prompt, instruções de sistema e qualquer contexto adicional —, enquanto tokens de saída são o que o modelo gera como resposta, geralmente cobrados a um valor mais alto porque gerar texto exige mais processamento do que apenas lê-lo. Esta calculadora multiplica sua média de tokens de entrada e saída por requisição pelas tarifas de cada modelo da OpenAI, e depois multiplica pelo número esperado de requisições por mês para estimar o gasto total. A OpenAI também oferece uma tarifa reduzida de cache para prefixos de prompt repetidos e um desconto para processamento em lote (batch) assíncrono — nenhum dos dois é aplicado aqui, então sua conta real pode acabar sendo menor se você usar esses recursos.
Quanto custa uma carga de trabalho real na API da OpenAI
A forma mais rápida de entender o preço da OpenAI é fazer a conta de um cenário concreto. Imagine um chatbot de suporte com 10.000 conversas por mês e cerca de oito trocas por conversa. Cada requisição carrega uns 1.500 tokens de entrada — system prompt mais o histórico acumulado — e gera por volta de 200 tokens de saída. São 80.000 requisições, ou aproximadamente 120 milhões de tokens de entrada e 16 milhões de saída por mês.
No GPT-5.6 Luna, com as tarifas exibidas na calculadora acima, essa carga fica na casa das poucas centenas de dólares mensais. Rode o mesmíssimo tráfego no tier topo de linha Sol e a fatura mais ou menos quintuplica, passando bem de mil dólares. O produto não mudou — só o modelo. Na prática, a escolha do modelo, e não o volume de tráfego, costuma ser a maior alavanca da fatura. Use o seletor de moeda do site para ver os valores também em reais.
Pipelines de documentos se comportam diferente: resumir é pesado em entrada — documentos longos entram, resumos curtos saem —, então favorece modelos com entrada barata e ganha muito com os descontos de batch. A conta completa de cenários de chat está em quanto custa rodar um chatbot de verdade; e se a dúvida é API contra assinatura do ChatGPT Plus, o ponto de equilíbrio está em API vs assinatura.
Pegadinhas de cobrança que inflam a fatura em silêncio
Aplicações de chat reenviam o histórico inteiro a cada turno, então o consumo de entrada cresce com o quadrado do tamanho da conversa: o décimo turno custa muito mais que o segundo, mesmo com mensagens parecidas. System prompts longos compõem o mesmo efeito — 700 tokens de system prompt são cobrados em toda requisição; num milhão de requisições, são 700 milhões de tokens de entrada gastos antes de qualquer texto do usuário.
Saídas verbosas são o outro custo silencioso: sem instrução explícita, os modelos respondem com preâmbulos educados e JSON cheio de formatação, tudo cobrado na tarifa mais cara, a de saída. Na direção oposta, a OpenAI dá desconto para entrada em cache (prefixos de prompt repetidos) e cobra cerca de metade do preço na Batch API para trabalhos que podem esperar — deixar isso na mesa é prejuízo real.
Como cortar a fatura sem mudar o produto
A maioria dos times compra inteligência demais. Um padrão prático é o roteamento de modelos: mande o tráfego fácil e volumoso para um modelo pequeno e escale só os casos ambíguos para um maior. Combine isso com três hábitos — enxugar o system prompt ao essencial, limitar ou resumir o histórico depois de alguns turnos e impor limite explícito de tamanho de resposta.
Antes de decidir, meça em vez de chutar: cole um prompt representativo na calculadora de tokens para ver o custo real em cada modelo e use o comparativo GPT vs Claude para conferir se um modelo equivalente da Anthropic sai melhor para o seu mix de entrada/saída.
Como os tiers da OpenAI se comparam ao resto do mercado
Preço de tabela só significa alguma coisa ao lado das alternativas, então aqui está a tabela de agosto de 2026 que a calculadora usa, por milhão de tokens (entrada / saída). A OpenAI mantém três tiers na mesma janela de 1,05M tokens: GPT-5.6 Sol a US$ 5,00 / US$ 30,00, Terra a US$ 2,00 / US$ 12,00 e Luna a US$ 0,20 / US$ 1,20. Terra e Luna foram reprecificados em 30 de julho de 2026 — Luna em 80% e Terra em 20% —, então qualquer cotação que você tenha feito em julho está alta. A linha da Anthropic fica perto do Sol na entrada e mais barata na saída — Claude Opus 4.8 US$ 5,00 / US$ 25,00, Sonnet 5 US$ 3,00 / US$ 15,00 e Haiku 4.5 US$ 1,00 / US$ 5,00 — porém com janela de 200k em vez de um milhão.
Esse corte jogou o Luna num território que antes era só dos modelos de peso aberto. Gemini 2.5 Flash custa US$ 0,30 / US$ 2,50, Nemotron 3 Ultra US$ 0,50 / US$ 2,20 e Llama 4 Maverick US$ 0,20 / US$ 0,60 — o Maverick segue sendo o piso, mas o Luna agora fica abaixo do Flash e do Nemotron nos dois lados do medidor, carregando o nome de uma família de ponta. Contra o Sol, o Luna é 25 vezes mais barato na saída com a mesma janela de contexto. Se a troca de capacidade compensa depende inteiramente da tarefa; o jeito honesto de descobrir é precificar a mesma carga nos dois e rodar sua própria avaliação. Nossa comparação GPT vs Claude faz o confronto direto, e o guia das APIs mais baratas cobre a ponta econômica.
Perguntas frequentes
Por que os tokens de saída são mais caros que os de entrada?
Gerar um token exige uma passagem completa pelo modelo para cada token produzido, enquanto a leitura do texto de entrada pode ser processada de forma mais eficiente. Esse custo extra de processamento é repassado no preço da OpenAI, onde os tokens de saída costumam custar várias vezes mais que os de entrada.
Isso inclui créditos do teste gratuito?
Não. Esta calculadora assume o preço padrão de pagamento por uso (pay-as-you-go). Se você estiver usando créditos de teste gratuito, sua conta real será menor até esses créditos acabarem.
Quão precisa é a estimativa?
Usamos os preços por modelo publicados, obtidos do feed de preços em tempo real do OpenRouter, com um valor fixo de reserva (fallback). A contagem real de tokens depende do seu prompt específico, então trate isto como uma estimativa de planejamento, não como uma previsão exata de fatura.
Por qual modelo da OpenAI um chatbot sensível a custo deve começar?
Comece pelo GPT-5.6 Luna e só escale quando a qualidade medida ficar aquém. Para a maior parte do tráfego de suporte e FAQ, modelos pequenos respondem bem à maioria das requisições; rotear os 10% difíceis para o GPT-5.6 Terra mantém a qualidade sem pagar tarifa de modelo grande em toda mensagem.
Requisições com erro ou abandonadas são cobradas?
Requisições que chegam ao modelo e geram tokens são cobradas, mesmo que a aplicação descarte a resposta ou o usuário feche a aba no meio do streaming. Retries no cliente podem dobrar o consumo sem ninguém notar — deixe a lógica de retry idempotente e registre o uso de tokens por requisição para pegar surpresas cedo.
Esses são os preços vivos da OpenAI ou uma tabela guardada?
A calculadora tenta primeiro a tarifa viva: uma rota com cache consulta o catálogo do OpenRouter e cai na nossa tabela verificada se a requisição falhar ou o modelo não existir por lá. Os números do fallback foram conferidos na página oficial de preços da OpenAI em julho de 2026. De todo jeito, trate o resultado como estimativa e confirme a tarifa atual na página do provedor antes de fechar um orçamento.
Os três tiers do GPT-5.6 cobram igual pela janela de contexto?
Eles compartilham a mesma janela de 1,05M tokens, mas você paga pelos tokens que realmente envia, não pelo tamanho da janela. Um prompt de 1M tokens custa US$ 5,00 no Sol e US$ 0,20 no Luna nos preços de tabela de agosto de 2026 — 25 vezes de diferença sobre a mesma entrada. O que muda entre os tiers é capacidade, não o teto — então mandar um trabalho de contexto longo para um tier mais barato que dá conta é uma das economias mais fáceis que existem.
Por que minha fatura real vem maior que a estimativa daqui?
Os suspeitos de sempre são retentativas, prompt de sistema reenviado a cada chamada, histórico de conversa que cresce a cada turno e tokens de raciocínio cobrados como saída nos modelos que os produzem. Esta calculadora precifica uma chamada com os números que você digitou, então multiplique pelo volume real e some uma margem para retentativas. A seção de pegadinhas de cobrança acima detalha cada um desses casos.
Quer saber de onde vêm estes números? Leia nossa metodologia de preços.