Alugar GPU para IA: quanto custa de verdade a hora de uma H100
Por LW Forge — mantenedora do LLM Scout · Atualizado em 24 de agosto de 2026
A mesma NVIDIA H100 custa US$ 1,65 por hora num marketplace e US$ 11,06 por hora no Google Cloud. Silício idêntico, diferença de 6,7× e nenhum benchmark vai fechar esse buraco — o que você paga é estrutura de contrato, suporte, rede e quem assume o prejuízo quando um nó cai. Antes de decidir se vale rodar inferência por conta própria, é preciso saber qual dessas coisas você está comprando.
Quanto custa a H100, por provedor
Estas são tarifas on-demand por GPU-hora, conferidas em 06/07/2026. Diferente dos preços de API de LLM, os números de GPU deste site são um retrato levantado à mão, não um feed ao vivo — não existe API pública e gratuita que agregue preço de GPU cloud. Confira sempre a página oficial do provedor antes de fechar orçamento; a página de fontes lista todas.
| Provedor | Tipo | US$/h | ~US$/mês (730h) |
|---|---|---|---|
| Vast.ai | Marketplace | 1,65* | 1.205 |
| RunPod | GPU cloud | 2,89 | 2.110 |
| Lambda Labs | GPU cloud | 3,99 | 2.913 |
| CoreWeave | GPU cloud | 4,25* | 3.103 |
| Paperspace / DigitalOcean | GPU cloud | 5,95 | 4.344 |
| AWS (P5) | Hyperscaler | 6,88 | 5.022 |
| Azure (NC H100 v5) | Hyperscaler | 6,98 | 5.095 |
| Google Cloud (A3) | Hyperscaler | 11,06 | 8.074 |
* Estimativas. A Vast.ai é um marketplace em que hosts verificados variavam entre US$ 1,50 e US$ 1,87/h; a tarifa por GPU da CoreWeave é derivada, não publicada como linha única. Trate as duas como faixa, não como cotação.
A A100 80GB conta a mesma história mais barato: Vast US$ 0,90, RunPod US$ 1,39, CoreWeave US$ 2,21, Lambda US$ 2,79, Paperspace US$ 3,18, Azure US$ 3,67, AWS US$ 4,10. E se o seu modelo couber em menos VRAM o piso desaba: uma L40S sai por US$ 0,99/h na RunPod e uma RTX 4090 por US$ 0,69 lá ou cerca de US$ 0,35 na Vast. A maioria das cargas de inferência que alguém descreve como "precisa de H100" cabe folgada numa placa de 48GB.
Três categorias de provedor explicam a diferença. Hyperscalers (AWS, GCP, Azure) cobram de 2× a 4× a tarifa das neoclouds e entregam contrato corporativo, papelada de compliance, rede privada e integração com o resto da sua stack — para quem já tem contrato e nota fiscal fechados com um deles, a inércia costuma valer parte do prêmio. GPU clouds especializadas (RunPod, Lambda, CoreWeave, Paperspace) reduzem tudo a um contêiner e um IP público. Marketplaces (Vast.ai) revendem hardware ocioso de terceiros — a hora mais barata, com a maior variação em confiabilidade, velocidade de disco e uptime. Para jobs em lote que podem ser reiniciados, essa variação é quase de graça. Para um endpoint que o usuário enxerga, não é.
Uma conferida em 04/08/2026 indica que o mercado andou para baixo desde o nosso retrato: neoclouds anunciam H100 a partir de mais ou menos US$ 2,00–2,50/h, e a B200 fica na faixa de US$ 3,70–7,00 por GPU-hora fora dos hyperscalers. A direção é de queda.
Spot, on-demand e reservado
On-demand é o número da tabela: sobe, desce, paga por segundo ou minuto. Os tiers spot / interruptível / community costumam ficar de 40% a 60% abaixo do on-demand e podem ser retomados quase sem aviso — a 4090 na Community Cloud da RunPod por cerca de US$ 0,34 contra US$ 0,69 na Secure Cloud é uma diferença típica. Reservado, com compromisso de um a três anos, costuma ficar 30% a 40% abaixo do on-demand, e só compensa se a sua utilização for realmente contínua. A armadilha é assinar um ano de capacidade para um produto cujo tráfego ainda nem estabilizou.
A única conta que importa
Preço por hora é a unidade errada. O que interessa é custo por milhão de tokens servidos, comparado com simplesmente pagar uma API. Uma H100 na RunPod a US$ 2,89/h, 24 horas por dia: US$ 2.110 por mês. Agora gaste esse mesmo dinheiro em chamadas de API:
| Modelo | Saída US$/1M | Tokens de saída que US$ 2.110 compram |
|---|---|---|
| Llama 4 Maverick | 0,60 | ~3,5 bilhões |
| Nemotron 3 Ultra | 2,20 | ~960 milhões |
| Gemini 2.5 Flash | 2,50 | ~844 milhões |
| Claude Sonnet 5 | 15,00 | ~141 milhões |
| GPT-5.6 Sol | 30,00 | ~70 milhões |
Para ganhar da tarifa do Maverick, a sua H100 precisa sustentar cerca de 1.340 tokens de saída por segundo, em todos os segundos do mês. É viável para um modelo pequeno rodando em vLLM com bastante batching — mas só com utilização perto do máximo. Caia para 25%, que é realista num produto com pico diário e madrugada vazia, e o custo efetivo vira algo em torno de US$ 2,41 por milhão de tokens de saída: quatro vezes a tarifa do Maverick e pior que o preço hospedado do Nemotron 3 Ultra.
A decisão é essa, e não tem a ver com hardware. Hospedar por conta própria compete com a faixa barata de modelos abertos, praticamente nunca com um modelo de ponta que você nem conseguiria hospedar. Para ver a mesma pergunta pelo lado do modelo, Nemotron 3 e a conta dos pesos abertos é a outra metade. Simule a sua configuração na calculadora de custo de GPU cloud e confira seus volumes reais na calculadora de tokens antes de confiar numa estimativa por palavras.
Os custos que não aparecem na tarifa por hora
Ociosidade. Você aluga horas, não tokens. Um pod a 20% de utilização custa 5× por token o que a ficha técnica sugere. É o maior custo escondido e quase ninguém modela isso antes.
Storage e cold start. Os pesos moram num volume persistente a mais ou menos US$ 0,05–0,10 por GB/mês. Um checkpoint de 550B em FP8 tem algumas centenas de gigabytes — dezenas de dólares por mês, mais minutos de download a cada partida a frio, o que mata em silêncio qualquer plano de escalar para zero.
Egress. Token de texto é desprezível: um bilhão de tokens de saída dá uns 4GB, menos de um dólar na tarifa de hyperscaler. A conta chega quando você move checkpoints — 500GB saindo da AWS a US$ 0,09/GB são US$ 45 por cópia, toda vez que troca de provedor.
Operação. Alguém sobe o servidor, ajusta batching, depura OOM e cuida de nó morto. Quatro horas por semana de uma pessoa de engenharia a US$ 80/h de custo cheio dão cerca de US$ 1.386 por mês — mais que a própria H100 no preço da RunPod. No Brasil o custo por hora é menor, mas a proporção raramente muda: a operação pesa mais que a placa.
Somando tudo, a regra honesta é: hospede você mesmo quando tiver volume alto e contínuo, exigência dura de residência de dados ou um modelo ajustado sem equivalente hospedado. Fora disso, a API ganha no custo total, e a discussão nunca foi sobre a GPU. Se a sua motivação é só preço, comece pelas APIs de LLM mais baratas de 2026 ou pela comparação de custo do DeepSeek — o teto de economia por ali costuma ser maior que qualquer coisa que uma H100 alugada entregue.