Todos os artigos

Quanto custa uma query de RAG: onde o dinheiro realmente vai

Por LW Forge — mantenedora do LLM Scout · Atualizado em 31 de agosto de 2026

Quase toda estimativa de custo de RAG que você lê por aí erra na mesma direção: obceca pelo modelo de embedding e acena para a chamada de geração. A aritmética diz o contrário. Fazer o embedding da pergunta do usuário custa uma fração de centavo por mil queries. A chamada que transforma quatro trechos recuperados em uma resposta custa de cem a mil vezes mais. Se você quer um sistema de RAG mais barato, mexe no segundo número.

Uma única query cobra três coisas:

  1. O embedding da pergunta — o texto da query passa por um modelo de embedding e vira um vetor. Só tokens de entrada, sem saída.
  2. O contexto recuperado — os trechos que você puxou do banco vetorial são colados no prompt e cobrados como tokens de entrada comuns.
  3. A geração — a resposta do modelo, cobrada como tokens de saída, tipicamente a 5-6× a tarifa de entrada.

A recuperação em si — a busca por vizinhos mais próximos — não é cobrada por token. Ela faz parte do que o seu banco vetorial cobra, que é uma linha de custo à parte e voltaremos a ela.

O exemplo trabalhado: 10.000 queries por mês

Pegue um formato realista: quatro trechos de 500 tokens cada (2.000 tokens de contexto recuperado), um system prompt mais a pergunta somando uns 300 tokens, e uma resposta de 400 tokens. São 2.300 tokens de entrada e 400 de saída por query — 23M de entrada e 4M de saída ao longo de 10.000 queries.

ModeloEntrada (23M)Saída (4M)MensalPor query
GPT-5.6 Sol (US$ 5,00/US$ 30,00)US$ 115,00US$ 120,00US$ 235,00US$ 0,0235
Claude Sonnet 5 (US$ 3,00/US$ 15,00)US$ 69,00US$ 60,00US$ 129,00US$ 0,0129
Claude Haiku 4.5 (US$ 1,00/US$ 5,00)US$ 23,00US$ 20,00US$ 43,00US$ 0,0043
GPT-5.6 Luna (US$ 0,20/US$ 1,20)US$ 4,60US$ 4,80US$ 9,40US$ 0,00094

Uma diferença de 25× entre a primeira e a última linha, com recuperação idêntica. Repare nos números da Luna: a OpenAI cortou a Luna em 80% e a Terra em 20% em 30/07/2026, coisa recente o bastante para a maioria dos textos sobre custo de RAG ainda citar os valores antigos. Rode os seus próprios tamanhos de token na calculadora de custo da OpenAI ou na calculadora de custo do Claude antes de fechar em um tier.

O embedding é mesmo erro de arredondamento

Agora some o embedding. O text-embedding-3-small da OpenAI custa US$ 0,02 por 1M de tokens e o text-embedding-3-large, US$ 0,13 por 1M (conferido nas páginas oficiais de preço, agosto de 2026; a Batch API corta os dois pela metade). Reserve uns 100 tokens por query contando a pergunta mais qualquer reescrita, e 10.000 queries dão 1M de tokens: US$ 0,02 por mês no modelo pequeno, US$ 0,13 no grande.

Contra US$ 43 no Haiku, essa linha de embedding é 0,05% da conta. Aumente a escala e continua absurda: 500.000 queries por mês custam cerca de US$ 1 no 3-small e US$ 6,50 no 3-large. Escolher o modelo de embedding mais caro para ganhar qualidade de recuperação é um dos upgrades mais baratos da stack — pode somar poucos dólares por mês e eliminar respostas erradas inteiras.

Para onde vai o dinheiro, então? Dentro da chamada de geração, a saída representa uns 45-50% do custo com respostas de 400 tokens e passa de 60% aos 800 tokens, porque a saída é cobrada a 5× a entrada no Claude e 6× no GPT-5.6. Duas consequências práticas: limitar o tamanho da resposta costuma ser uma alavanca maior do que cair de quatro trechos para três, e um modelo prolixo custa mais do que a tarifa por token dele sugere. Meça contagens reais na calculadora de tokens em vez de estimar por número de palavras — por que 1.000 palavras não são 1.000 tokens explica a diferença.

O custo que ninguém orça

Troque o modelo de embedding, ou mude a estratégia de chunking, e todos os vetores do seu banco ficam inválidos. Você refaz o embedding do corpus inteiro. Os times se preparam para uma conta gigante de API aqui — e normalmente não é. Cinco milhões de documentos com média de 800 tokens dão 4B de tokens; refazer o embedding custa cerca de US$ 80 no 3-small ou US$ 520 no 3-large. Doloroso, não catastrófico.

Os custos reais de um re-embedding são os que não aparecem na fatura do modelo:

  • Armazenamento. Vetores ocupam dimensões × 4 bytes. Dez milhões de trechos a 1.536 dimensões dão uns 61 GB de floats crus; a 3.072 dimensões dobra para 123 GB, antes do overhead do índice. Bancos vetoriais gerenciados cobram por GB-mês, então dobrar as dimensões dobra uma linha recorrente para sempre. O text-embedding-3-large permite truncar para menos dimensões, e vale medir isso contra o custo de armazenamento.
  • A janela de reconstrução. Quatro bilhões de tokens por um endpoint com rate limit levam dias, não minutos, e você ou mantém dois índices em paralelo ou serve resultados desatualizados enquanto a fila drena.
  • A reavaliação. Vetores novos significam que a qualidade da sua recuperação mudou. Se você não roda de novo um conjunto de avaliação, trocou um sistema conhecido por um desconhecido.

Orce a migração como tempo de engenharia mais um aumento permanente de armazenamento, e trate o custo de token como a parte pequena. Esse enquadramento também diz quando trocar: se um modelo de embedding melhor elimina uma classe de respostas erradas, US$ 520 uma vez só e um índice maior valem trivialmente a pena.

RAG ou só uma janela de contexto enorme?

A alternativa tentadora é pular a recuperação e colar a base de conhecimento inteira em todo prompt. Com uma base de 150.000 tokens no Claude Sonnet 5, um prefixo estável em cache é cobrado a cerca de 10% da tarifa de entrada — US$ 0,045 por query — mais US$ 0,006 pela resposta de 400 tokens.

Queries / mêsColar tudo (com cache)RAG (4 trechos)
500US$ 25,50US$ 6,45
5.000US$ 255,00US$ 64,50
50.000US$ 2.550,00US$ 645,00

O RAG sai 4× mais barato em tokens em qualquer volume, e a distância aumenta sem cache, onde colar tudo custa US$ 0,45 por query em vez de US$ 0,045. Mas o RAG carrega custos fixos que a tabela não mostra: um banco vetorial, um pipeline de ingestão e o tempo de engenharia para manter os dois honestos. Abaixo de algumas centenas de queries por mês, a mensalidade mínima de um banco vetorial gerenciado pode superar toda a economia de tokens, e colar um prefixo em cache é a escolha racional. Acima de alguns milhares, a recuperação ganha no custo e continua ganhando.

Duas restrições decidem isso antes do preço. Uma base maior que a janela de contexto elimina de saída a opção de colar tudo — confira a sua na calculadora de janela de contexto. E o cache só compensa se o prefixo for de fato estável e acionado com frequência suficiente para sobreviver ao TTL; economia com prompt caching detalha quando compensa e quando não.

O que cortar primeiro

Em ordem de retorno: encurtar a resposta, depois cair para um tier mais barato e medir se a qualidade realmente mudou, depois cachear o prefixo estável do prompt, depois mandar em batch tudo que não for interativo pela metade do preço, e só então discutir número de trechos. Recuperar três trechos em vez de quatro economiza 500 tokens de entrada — US$ 1,50 por milhão de queries no Sonnet. Cortar respostas de 800 para 400 tokens economiza US$ 6,00 no mesmo volume.

Se você está orçando isso do Brasil, lembre que a fatura chega em dólar e aterrissa em reais com imposto e spread por cima — quanto custa a API da OpenAI em reais tem essa aritmética. E para a versão ponta a ponta de um produto conversacional, quanto custa de verdade um chatbot cobre as partes que o RAG não cobre.