Todos os artigos

Claude ou ChatGPT: qual é melhor no custo? Sonnet 5 vs GPT-5.6

Por LW Forge — mantenedora do LLM Scout · Atualizado em 13 de julho de 2026

Toda tabela de "Claude vs GPT" na internet comete o mesmo pecado: compara números que não são comparáveis. Preço por milhão de tokens parece uma métrica objetiva, mas entre dois provedores ela esconde tokenizadores diferentes, verbosidade de resposta diferente, mecânicas de cache diferentes e tiers de capacidade diferentes. Este artigo monta uma comparação que aguentaria uma reunião de orçamento — pelo ângulo que interessa: o custo.

Por que o número de manchete engana

Três distorções ficam entre o preço de tabela e a sua fatura.

Tokenizadores contam diferente. O mesmo prompt produz contagens de tokens diferentes no tokenizador da OpenAI e no da Anthropic — uma diferença de vários por cento, maior ainda em português. Um modelo 10% mais barato por token que conta 10% mais tokens não é mais barato. Meça com o seu próprio texto na calculadora de tokens antes de confiar em qualquer tabela.

A verbosidade padrão difere. Sem instrução explícita, os dois modelos respondem em comprimentos diferentes, e cada token extra é cobrado na tarifa de saída — a cara, 5-6× a de entrada nas tabelas atuais dos dois provedores. Limite o tamanho da resposta igualmente dos dois lados, ou a sua comparação de "preço" é na verdade uma comparação de verbosidade.

O cache funciona diferente. A OpenAI aplica desconto de entrada em cache automaticamente a prefixos repetidos. O prompt caching da Anthropic é explícito: você marca os pontos de cache, paga um prêmio de ~25% para gravar e depois lê a cerca de um décimo da tarifa de entrada. Para um chatbot de tráfego constante com prompt de sistema grande, os dois esquemas cortam muito o custo de entrada — mas o esforço de engenharia para capturar o desconto difere, e uma integração ingênua captura o da OpenAI de graça enquanto deixa o da Anthropic na mesa.

Mapeie os tiers antes de comparar

Em julho de 2026, os pareamentos justos entre as duas linhas são estes: o Sol, topo de linha da OpenAI, contra o Claude Opus 4.8; o Terra, cavalo de batalha, contra o Claude Sonnet 5; e o Luna, econômico, contra o Claude Haiku 4.5. A preço de tabela, cada par fica surpreendentemente próximo — tiers pareados caem a uns 20-40% um do outro na entrada, com a Anthropic um pouco mais barata na saída do topo de linha e a OpenAI um pouco mais barata no econômico.

Uma nota de timing: o Sonnet 5 foi lançado com preço promocional (cerca de um terço a menos) até o fim de agosto de 2026. Promoção é dinheiro de verdade enquanto dura, mas orce pela tarifa cheia — promoções expiram, migrações não.

A consequência prática: cruzar tiers produz a conclusão que você quiser. Terra vs Haiku "prova" que a OpenAI é cara; Luna vs Sonnet 5 "prova" que a Anthropic é. Qualquer comparação que você leia (inclusive a nossa) só faz sentido dentro de um tier pareado — veja os números atuais lado a lado na comparação GPT vs Claude.

Compare custo por tarefa, não custo por token

A unidade honesta é o que custa obter um resultado correto, e a receita é curta:

  1. Fixe um conjunto de tarefas. Vinte a cinquenta exemplos reais do seu produto — não benchmarks, os seus prompts de verdade.
  2. Trave as variáveis. Mesmas instruções, mesmo limite de saída, mesma temperatura nos dois modelos.
  3. Conte tokens por tarefa concluída. Inclua as tentativas repetidas: modelo que erra e precisa de segunda tentativa paga dobrado, e a conta dele deve refletir isso.
  4. Divida o gasto pelos acertos. Custo por tarefa bem-sucedida é o número que pertence ao seu orçamento.

Rode essa receita e o ranking frequentemente inverte o que a tabela de preços previa: um modelo 25% mais caro por token, mas mais confiável na sua tarefa, ou que responde mais seco, sai rotineiramente mais barato por tarefa. É aqui também que os dois provedores se diferenciam mais do que as tabelas sugerem — times pesados em código costumam descobrir que um dos modelos precisa de menos rodadas de correção no stack deles, e isso engole a diferença por token.

Quando a diferença importa de verdade

Se a sua comparação de tier pareado cair dentro de uns 30%, a diferença de preço é ruído: o custo de trocar (reescrever prompts, reconstruir avaliações, novos modos de falha) come uma diferença desse tamanho, e a escolha deve ser por qualidade, latência e ecossistema. Uma diferença consistente de 2-3× na sua carga medida é outra história — isso é estrutural e justifica migração. Entre esses limites, o roteamento híbrido costuma ser a resposta real: mande o grosso do tráfego para o modelo econômico que passar na sua régua de qualidade e reserve o tier topo para as requisições que precisam dele, não importa o logotipo.

Rode seus próprios números

Coloque o mesmo perfil de tokens na comparação GPT vs Claude para ver o lado a lado atual — em dólares ou reais, pelo seletor de moeda — e confira cada lado isoladamente nas calculadoras da OpenAI e do Claude. Se a carga em questão for um chatbot, a conta detalhada de quanto custa rodar um chatbot de verdade transfere direto — basta trocar pelas tarifas da Anthropic.