Todos os artigos

Batch API: economia real de 50%, ou promessa com pegadinha?

Por LW Forge — mantenedora do LLM Scout · Atualizado em 7 de setembro de 2026

Um desconto fixo de 50%, aplicado em todo modelo, sem piso de volume e sem contrato separado, soa como o tipo de oferta que esconde uma pegadinha na letra miúda. Na maior parte, não esconde. Tanto a Batch API da OpenAI quanto a Message Batches API da Anthropic cortam a tarifa por token pela metade, de forma uniforme, para requisições que você topa enviar em lote em vez de chamar uma a uma. A pegadinha real é mais simples e vem declarada de cara: o resultado volta dentro de uma janela de 24 horas, não na hora. Se isso é dinheiro de graça ou uma troca ruim depende inteiramente de a sua carga já ter sido tempo real para começo de conversa.

O que o desconto realmente é

Envie um lote de requisições — um arquivo JSON com uma linha por chamada, no formato da OpenAI, ou uma estrutura equivalente na Anthropic — e o provedor processa tudo de forma assíncrona, fora da fila normal de requisições, à metade da tarifa de tabela de entrada e saída. Os lotes da OpenAI costumam terminar em poucas horas na maioria das cargas e são garantidos em até 24. A Message Batches API da Anthropic funciona igual: 50% abaixo do preço padrão, resultado em até 24 horas. Nenhum dos dois provedores varia o desconto por tier de modelo — uma chamada em lote para um modelo de topo recebe o mesmo 50% que uma chamada em lote para o tier econômico.

Nos preços de agosto de 2026, isso é mecânico: os US$ 5,00 / US$ 30,00 por milhão de tokens do GPT-5.6 Sol viram US$ 2,50 / US$ 15,00 em lote. Os US$ 3,00 / US$ 15,00 do Claude Sonnet 5 viram US$ 1,50 / US$ 7,50. Rode os mesmos números para o seu volume nas calculadoras da OpenAI ou do Claude e depois divida o total por dois — essa é a sua estimativa em lote.

A pegadinha é real, mas não está escondida

O SLA de 24 horas está declarado com todas as letras na documentação dos dois provedores, então chamar isso de "pegadinha" é generoso — é uma troca oferecida explicitamente, não algo que você descobre depois. O risco real é os times subestimarem quanto da carga deles é de fato sensível à latência. Três perguntas separam um bom candidato a lote de um ruim:

  1. Um humano está esperando essa resposta agora? Se sim — uma resposta de chat, um atendimento ao vivo, uma sugestão de autocomplete — o lote está desqualificado, não importa a economia. Um desconto de 50% numa resposta que ninguém consegue esperar 24 horas não é desconto, é produto quebrado.
  2. A saída é consumida por um processo posterior, não por uma pessoa? Reclassificar de madrugada o backlog de tickets de suporte, classificação em massa de registros históricos, resumir de um dia inteiro de documentos de um dia para o outro — nada disso tem uma pessoa olhando pra um spinner, exatamente o formato que o lote recompensa.
  3. Você aguenta a cauda, não só a média? "Poucas horas" é típico, não garantido. Se um relatório precisa existir até as 9h e você envia o lote às 23h, tem margem. Se envia às 7h para um prazo das 9h, está apostando contra o teto declarado do SLA.

Onde o desconto realmente aparece

Classificação e etiquetagem em massa. Ordenar 500 mil tickets de suporte por categoria, sentimento ou urgência de madrugada é quase o caso de uso canônico de lote: volume alto, ninguém olhando o resultado, naturalmente agendável. No GPT-5.6 Luna, uma rodada de 500 mil tickets a 300 tokens de entrada e 20 de saída cada — 150M de entrada, 10M de saída — custa cerca de US$ 34 na tarifa padrão e US$ 17 em lote.

Geração de dataset e avaliação. Rodar um modelo contra milhares de prompts de avaliação, ou gerar dados sintéticos de treino, é intrinsecamente não interativo. O lote corta pela metade o custo de uma tarefa que já ia rodar sem ninguém olhando.

Pipelines de documentos com agenda, não prazo apertado. Resumir a entrada de PDFs de ontem antes do time chegar de manhã cabe naturalmente no SLA, já que "antes das 9h" e "dentro de 24 horas a partir de um envio às 23h" são a mesma restrição. Veja a análise completa de custo de resumir um PDF para a conta por documento que isso empilha em cima.

Refazer embedding depois de trocar de modelo ou de estratégia de chunking. A análise de custo de RAG cobre isso em detalhe: refazer o embedding de um corpus grande é exatamente o tipo de tarefa pontual, de agenda e não de prazo apertado, para a qual a janela de 24 horas foi feita — e costuma ser a maior conta pontual na vida de um sistema de RAG.

Onde não se aplica, mesmo com a tentação real

O erro mais comum que vemos é aplicar lote a uma carga que "normalmente" não é urgente mas ocasionalmente é — um sistema de suporte que é 95% processamento de backlog de madrugada e 5% "o CEO precisa dessa resposta agora". Separar esse tráfego pela urgência real, em vez de colocar tudo em lote pela média, protege os 5% sem abrir mão do desconto nos 95%. Chamadas em lote e em tempo real para o mesmo modelo podem rodar lado a lado; usar uma não desqualifica a outra para uma parte diferente do mesmo sistema.

Empilhando com outros descontos

O preço de lote e o prompt caching resolvem problemas diferentes e se combinam sem atrito: o cache corta o custo de um prefixo estável repetido, o lote corta o custo de não precisar da resposta na hora, e nenhum depende do outro. Um job noturno em lote que reenvia o mesmo system prompt longo em cada uma de 100 mil chamadas se beneficia dos dois — cacheie o prefixo, coloque o job em lote — e as economias se multiplicam em vez de competir. Veja economia com prompt caching para a mecânica da outra metade dessa pilha.

O veredito honesto

O número de 50% é real, uniforme, e não é um número de marketing que encolhe quando você lê a letra miúda — os dois provedores aplicam exatamente como anunciado. A decisão que de fato exige julgamento não é "o desconto é real", é "essa tarefa algum dia foi tempo real". Audite a sua carga por essa pergunta antes da escolha de modelo, porque uma tarefa que não precisa de resposta instantânea vale exatamente o mesmo 50% rodando num modelo de topo ou num tier econômico — o desconto recompensa o formato da sua carga, não qual modelo você escolheu.