Sonnet 5 vs Haiku 4.5: quando o Claude mais barato já resolve
Por LW Forge — mantenedora do LLM Scout · Atualizado em 10 de agosto de 2026
O Opus é escolha de nicho para a maioria dos times. A decisão que realmente aparece na fatura, mês após mês, é Sonnet 5 versus Haiku 4.5 — e, como a Anthropic cobra os dois tiers com a mesma razão entre entrada e saída, o Sonnet custa exatamente três vezes o Haiku com tráfego idêntico. Não precisa modelar nada: qualquer que seja sua conta em um, multiplique ou divida por três para ter a do outro.
| Modelo | Entrada / 1M | Saída / 1M | Leitura de cache | Contexto |
|---|---|---|---|---|
| Claude Sonnet 5 | US$ 3,00 | US$ 15,00 | US$ 0,30 | 200 mil |
| Claude Haiku 4.5 | US$ 1,00 | US$ 5,00 | US$ 0,10 | 200 mil |
O Sonnet 5 está com promoção de lançamento de US$ 2/US$ 10 por milhão de tokens até 31 de agosto de 2026, o que estreita a diferença para 2× enquanto durar. Planeje pelas tarifas de tabela acima — a promoção acaba, a carga de trabalho não. Os dois tiers compartilham a mesma janela de 200 mil tokens, então descer para o Haiku nunca custa espaço para um documento longo; dá para conferir o que cabe na calculadora de janela de contexto.
Onde o 3× realmente dói
Considere um pipeline de enriquecimento de documentos: um milhão de documentos por mês, cada um enviando cerca de 800 tokens de entrada e gerando cerca de 60 tokens de saída em rótulos estruturados. Isso dá 800 milhões de tokens de entrada e 60 milhões de saída:
| Modelo | Custo de entrada | Custo de saída | Total mensal |
|---|---|---|---|
| Sonnet 5 | US$ 2.400 | US$ 900 | US$ 3.300 |
| Haiku 4.5 | US$ 800 | US$ 300 | US$ 1.100 |
São US$ 2.200 por mês numa tarefa cuja saída é um punhado de rótulos tirados de um vocabulário fixo. Some a Batch API — cerca de metade do preço quando o resultado pode esperar — e o Haiku cai para perto de US$ 550 contra US$ 1.650 do Sonnet. É esse o formato de carga em que o tier barato não é concessão: a tarefa é estreita, o espaço de respostas é pequeno e a correção é mensurável, não questão de gosto. Precifique seus próprios volumes na calculadora de custos do Claude.
A diferença pesa muito menos no formato oposto. Uma funcionalidade de produto com 20 mil requisições por mês, nos mesmos tamanhos de token, custa US$ 66 no Sonnet e US$ 22 no Haiku. Economizar US$ 44 arriscando a qualidade de algo que o usuário lê é mau negócio — em volume baixo, escolha o modelo melhor e gaste sua atenção em outro lugar.
Tarefas em que o Haiku empata de verdade
O Haiku se sai bem quando o trabalho é delimitado e a saída correta é verificável: classificação em categorias conhecidas, roteamento e triagem, extração para um schema fixo, detecção de sentimento e de idioma, deduplicação, resumos curtos de uma única fonte, moderação e filtragem de spam. O que essas tarefas têm em comum é permitir montar um conjunto de avaliação com algumas centenas de exemplos rotulados e medir acurácia direto, em vez de discutir se o texto "parece" melhor.
O Sonnet abre vantagem no que é aberto: conversa de múltiplos turnos com usuários reais, redação que precisa sustentar um tom, mudanças de código em vários arquivos, cadeias de chamadas de ferramenta em que uma leitura errada se propaga, resumo de fontes que se contradizem, qualquer coisa que exija perceber que a própria pergunta é ambígua. O sinal é este: errar é óbvio e barato de pegar, ou sutil e caro de deixar passar?
Teste antes de supor
O jeito honesto de resolver isso é chato e leva uma tarde. Separe de 200 a 500 requisições reais de produção. Rode nos dois tiers. Pontue as saídas contra o que "correto" significa para a sua tarefa — correspondência exata em classificação, revisão humana no que for mais subjetivo. Se o Haiku empatar com o Sonnet dentro da sua tolerância, o 3× é margem pura. Se não empatar, você passa a saber exatamente onde ele quebra, o que vale mais que uma opinião genérica sobre modelos pequenos.
Dois detalhes que distorcem esse teste se você pular: prompts afinados para um modelo maior costumam precisar de instruções mais explícitas e de um par de exemplos para funcionar num menor, então reajuste antes de concluir que o Haiku não dá conta. E meça o tamanho da saída — modelos menores às vezes compensam com respostas mais longas, e saída é cobrada a 5× a entrada nos dois tiers. Confira contagens reais na calculadora de tokens em vez de confiar numa estimativa por palavras; por que 1.000 palavras nunca são 1.000 tokens explica por que os dois números divergem.
O padrão de roteamento que captura quase toda a economia
Raramente é preciso escolher de forma global. Rode o Haiku primeiro, peça um sinal de confiança ou uma autoverificação, e escale só as requisições que falharem. No pipeline acima, escalar 10% do tráfego para o Sonnet custa cerca de US$ 1.320 por mês contra US$ 3.300 de tudo no Sonnet — mais ou menos 60% de economia, com os casos difíceis ainda atendidos pelo modelo mais forte. O custo disso é um desvio a mais no seu código e um limiar que você calibra com dados reais.
Empilhe as outras alavancas por cima: cacheie o prefixo estável do seu prompt por cerca de um décimo da tarifa de entrada (cache de prompt) e mande em lote tudo que não for interativo por cerca de metade do preço. Juntas, essas medidas costumam render mais do que a agonia sobre qual tier usar. Se a sua dúvida envolve os três tiers e não só esse par, Opus vs Sonnet vs Haiku traz a tabela completa, e quanto custa a API do ChatGPT abre um exemplo de ponta a ponta.