Todos os artigos

Kimi K3: o que é e por que agora custa mais que o Claude Sonnet 5

Por LW Forge — mantenedora do LLM Scout · Atualizado em 12 de agosto de 2026

Modelo de pesos abertos deveria ser a opção barata. O Kimi K3 não é. A Moonshot AI lançou o modelo em 16 de julho de 2026 como o primeiro aberto a chegar a 2,8 trilhões de parâmetros e colocou a API hospedada a US$ 3,00 por milhão de tokens de entrada e US$ 15,00 por milhão de saída — na época, a tarifa de tabela exata do Claude Sonnet 5. Essa coincidência não durou o mês: a Anthropic tornou permanente a tarifa de lançamento de US$ 2/US$ 10 do Sonnet 5 em vez de deixá-la expirar, então o K3 agora custa 50% a mais que o Sonnet, tanto na entrada quanto na saída. O K3 nunca disputou preço com o resto do campo aberto — disputa capacidade com os modelos fechados de fronteira —, mas o modelo de fronteira que ele mais se aproximava em preço acabou de ficar mais barato sem ele.

As tarifas, em 4 de agosto de 2026

ModeloEntrada / 1MSaída / 1MLeitura de cacheContexto
Kimi K3 (Moonshot direto)US$ 3,00US$ 15,00US$ 0,301M
Kimi K3 (OpenRouter)~US$ 2,90~US$ 14,00varia por host1M
Claude Opus 4.8US$ 5,00US$ 25,00US$ 0,50200 mil
Claude Sonnet 5US$ 2,00US$ 10,00US$ 0,20200 mil
GLM-5.2US$ 1,40US$ 4,40US$ 0,261M

A tarifa de cache do K3 é US$ 0,30 — exatos 90% de desconto sobre a própria entrada, a mesma estrutura que a Anthropic usa (a do Sonnet é US$ 0,20, 90% sobre a tarifa de entrada agora permanente de US$ 2). E, diferente do Gemini, o K3 cobra a mesma tarifa em toda a janela de um milhão de tokens; não há sobretaxa de contexto longo esperando na marca dos 200 mil.

O que a diferença de preço compra

A mesma carga usada no post irmão desta dupla: 300 milhões de tokens de entrada e 40 milhões de saída por mês, mais ou menos um assistente agêntico de porte médio.

ModeloCusto de entradaCusto de saídaTotal mensal
GLM-5.2US$ 420US$ 176US$ 596
Claude Sonnet 5US$ 600US$ 400US$ 1.000
Kimi K3US$ 900US$ 600US$ 1.500
Claude Opus 4.8US$ 1.500US$ 1.000US$ 2.500

Duas coisas saltam dessa tabela. Contra o Opus 4.8, o K3 ainda economiza US$ 1.000 por mês — 40%, número relevante se o K3 passar na sua barra de qualidade. Contra o Sonnet 5, a comparação virou: o que era empate exato de tabela em julho agora é o Sonnet permanentemente mais barato, em US$ 500 por mês — 33% a menos que o K3 no mesmo tráfego —, porque a Anthropic tornou a tarifa de lançamento padrão em vez de deixá-la expirar na data prevista. O K3 não tem mais argumento de custo contra o Sonnet 5, só capacidade e portabilidade. Precifique os seus volumes na calculadora de custos do Claude; veja o preço de lançamento do Sonnet 5 virou permanente para o anúncio.

A janela de 1M vale o que cobra?

O Claude para em 200 mil tokens; o K3 aceita 1 milhão. O instinto diz que isso economiza dinheiro em documento longo. Na maior parte das vezes não economiza, e vale entender por quê.

Suponha que você precise raciocinar sobre um corpus de 900 mil tokens. No K3 é uma chamada só: 900 mil × US$ 3/M = US$ 2,70 de entrada. No Claude você fatia — cinco passadas de 180 mil, cada uma carregando o mesmo prefixo de 30 mil tokens com instrução e schema. São 900 mil de documento mais 150 mil de prefixo repetido, e depois uma passada de redução sobre os cinco resumos. Dá cerca de 1,06 milhão de tokens de entrada, algo como US$ 2,12 no Sonnet à tarifa atual de US$ 2. A versão fatiada agora é a mais barata, em uns 20% — uma inversão em relação a quando o Sonnet custava US$ 3/M —, mesmo antes de contar que o cache de prompt sobre o prefixo repetido empurraria a diferença ainda mais a favor do Sonnet. A chamada única do K3 ainda ganha em simplicidade, só não em preço.

O argumento real da janela de 1M não é a fatura, é o que a versão fatiada não consegue fazer: perceber que uma cláusula da página 40 contradiz uma tabela da página 380. Map-reduce perde referência cruzada por construção, e nenhuma engenharia de prompt devolve isso. Se a sua tarefa realmente exige raciocínio sobre o corpus inteiro, a janela vale o preço; se é "resuma cada seção", não vale. Meça o que os seus documentos ocupam de fato na calculadora de janela de contexto antes de supor que precisa do espaço extra — a maioria das cargas que parecem enormes fica abaixo de 200 mil.

Onde o K3 justifica o premium — e onde não justifica

O argumento honesto a favor do K3 sobre o Sonnet 5, agora que o Sonnet é o mais barato dos dois, é portabilidade, não preço. Os pesos são públicos sob licença MIT modificada, então a API hospedada é conveniência, não dependência. Dá para trocar de host, rodar inferência própria numa carga que não pode sair da sua infraestrutura ou continuar servindo uma versão congelada depois que o fornecedor a descontinuar. Nada disso está disponível no Claude a preço nenhum. Se o que trava o seu projeto é cláusula de residência de dados ou análise de risco de fornecedor, isso vale zero de diferença de preço e muito trabalho destravado.

O argumento contra é o imposto habitual dos pesos abertos: maturidade de SDK, casos de borda em saída estruturada, integração com observabilidade e o fato de que, em agregador, o host que atende a sua requisição pode rodar uma quantização diferente da que você testou. A API hospedada da Moonshot também opera sob jurisdição chinesa — questão de governança que os pesos abertos só resolvem se você realmente rodar por conta própria.

Contra o Opus 4.8 a conta muda: você paga 40% menos por um modelo que troca o raciocínio de ponta do Opus por uma janela 5× maior e por pesos abertos. Se é bom negócio depende de com que frequência o seu tráfego cai nos 10% de tarefas mais difíceis, onde o modelo de fronteira ainda vence comparações mensuráveis. Opus vs Sonnet vs Haiku mostra como classificar esse tráfego, e a lógica de roteamento de Sonnet 5 vs Haiku 4.5 vale aqui também: rode o tier barato primeiro e escale só o que falhar numa autoverificação.

Como decidir em uma tarde

Separe 200 requisições reais. Rode no K3, no Sonnet 5 e no Opus 4.8 com instruções e limites de saída idênticos. Pontue a correção do jeito que você já pontua e calcule o custo por tarefa bem-sucedida, cobrando as tentativas repetidas do modelo que as causou. Se o K3 empatar com o Sonnet, o fator decisivo é portabilidade, não preço — e essa escolha merece ser deliberada, não por inércia. Se o K3 empatar com o Opus, você achou seus US$ 1.000 por mês.

Duas alavancas antes de concluir qualquer coisa: cacheie o prefixo estável a 10% da entrada nos três modelos (cache de prompt) e verifique se o raciocínio sempre ligado do K3 está inflando a sua contagem de tokens de saída, já que saída custa 5× a entrada em todos os modelos desta tabela. Se US$ 3/US$ 15 for mais do que a sua tarefa precisa, o GLM-5.2 a US$ 1,40/US$ 4,40 é a mesma aposta em pesos abertos por menos da metade do preço.