Todos os artigos

Modelo de IA open source grátis: a conta do Nemotron 3 e dos pesos abertos

Por LW Forge — mantenedora do LLM Scout · Atualizado em 24 de agosto de 2026

O Nemotron 3 Ultra, da NVIDIA, é um mixture-of-experts aberto de 550 bilhões de parâmetros, com 55 bilhões ativos e janela de contexto de 1 milhão de tokens. Você pode baixar os pesos. Também pode chamá-lo por um agregador a US$ 0,50 por milhão de tokens de entrada e US$ 2,20 de saída — ou de graça, num endpoint gratuito. Três preços para um modelo só parece confuso até você perceber que são respostas para três perguntas diferentes.

Os preços, em agosto de 2026

ModeloEntrada / 1MSaída / 1MContexto
Nemotron 3 Ultra (550B-A55B)US$ 0,50US$ 2,201M
Nemotron 3 Super (120B-A12B)US$ 0,09US$ 0,451M
Llama 4 MaverickUS$ 0,20US$ 0,601M
GLM-5.2US$ 1,40US$ 4,401M
Kimi K3US$ 3,00US$ 15,001M
Gemini 2.5 Flash (fechado)US$ 0,30US$ 2,501M
Claude Haiku 4.5 (fechado)US$ 1,00US$ 5,00200 mil

São tarifas de agregador conferidas na listagem ao vivo em 04/08/2026; a nossa última verificação foi 20/07/2026 e continua batendo. A primeira coisa a entender sobre pesos abertos é esta: não existe preço único. O mesmo checkpoint é servido por uma dúzia de hosts com tarifas, throughput, limites de contexto e quantizações diferentes. Um modelo ser aberto não conserta o preço dele; apenas elimina o vendedor único que poderia fixá-lo. Confira a tarifa atual antes de orçar — a página de fontes mostra de onde tiramos cada número.

A segunda: o Nemotron 3 Ultra a US$ 2,20 de saída não é a ponta barata dos pesos abertos. O Llama 4 Maverick é 3,7× mais barato na saída. O Nemotron 3 Super, irmão de 120B, sai quase 5× abaixo do Ultra. O Ultra é precificado como modelo de raciocínio e orquestração, e é o open-weight americano mais forte na maioria dos rankings públicos — você paga por isso. Se o que você quer é só o token competente mais barato, olhe as APIs de LLM mais baratas de 2026 ou a comparação com o DeepSeek.

A pegadinha do tier gratuito

Os agregadores listam endpoints gratuitos para o Nemotron 3 Ultra, o Super e o multimodal Nano Omni. São reais — pesos reais, inferência real, US$ 0,00 na fatura. O preço é cobrado em outro lugar.

No OpenRouter, usar endpoints gratuitos exige ligar logging e treinamento nas configurações de privacidade da conta. Existem chaves explícitas para "endpoints que podem treinar com as suas entradas" e "endpoints que podem publicar prompts", e os modelos gratuitos em geral ficam atrás delas. O tier grátis também vem com limites de requisição agressivos e nenhuma garantia de disponibilidade — o endpoint que funcionou no protótipo pode estar saturado ou sumido na semana do lançamento.

A leitura honesta, então: o tier gratuito é ótimo para avaliação, protótipo, projeto pessoal e qualquer prompt que você não se importaria de ver num dataset público. E é eliminatório para dado de cliente, informação sob NDA, prontuário, dado financeiro ou produto com SLA. Se você foi olhar pesos abertos justamente por causa de governança de dados e LGPD, o tier gratuito inverte exatamente a propriedade que você queria. Nos mesmos agregadores dá para filtrar endpoints pagos que não treinam com as suas entradas — é essa versão que vale precificar.

Quanto custa hospedar o Ultra de verdade

É aqui que o argumento do "você pode rodar por conta própria" encontra a aritmética. O Nemotron 3 Ultra em FP16 pede algo perto de 1,1 TB de memória de GPU. O deployment padrão usa oito GPUs com paralelismo de tensor entre elas; o checkpoint NVFP4 da NVIDIA reduz isso e roda em hardware Blackwell. De um jeito ou de outro, a unidade de implantação é um nó inteiro, não uma placa.

Oito H100 a US$ 2,89/h na RunPod dão US$ 23,12 por hora — US$ 16.878 por mês, rodando ou não. Na tarifa hospedada de US$ 2,20 por milhão de tokens de saída, esse mesmo dinheiro compra cerca de 7,7 bilhões de tokens de saída. Para empatar, você precisaria sustentar aproximadamente 2.900 tokens de saída por segundo, sem parar, o mês inteiro. Na AWS, a US$ 6,88 por H100-hora, o nó vai a uns US$ 40.200 mensais e o breakeven sobe para 18,3 bilhões de tokens. Simule o seu nó na calculadora de custo de GPU cloud; a comparação completa de preços de GPU traz a tabela por provedor e os custos escondidos — ociosidade, storage de checkpoint, egress, operação — que esta estimativa deixou de fora.

A versão generalizada da conta: uma GPU a US$ 2/hora rodando em tempo integral custa cerca de US$ 1.460 por mês, o que compra mais ou menos 2,4 bilhões de tokens de saída no Llama 4 Maverick ou 660 milhões no Nemotron 3 Ultra. Hospedar por conta própria compete com a faixa barata dos pesos abertos e quase nunca com um modelo de ponta — e, no caso específico do Ultra, uma GPU sozinha nem carrega o modelo.

Peso aberto ≠ API barata

São dois produtos diferentes que por acaso dividem o mesmo nome num leaderboard.

Peso aberto compra controle: rodar dentro da sua própria VPC ou sem conexão externa, garantir que nenhum terceiro veja um prompt, fazer fine-tuning com dado proprietário, congelar uma versão para que ela não mude debaixo de você e continuar servindo o modelo depois que o fornecedor perder o interesse. São propriedades de governança e continuidade. Valem dinheiro de verdade para quem opera sob regulação — e são as únicas razões que justificam o custo de forma confiável.

Uma API hospedada barata compra o token, e mais nada. Sem nó, sem afinar vLLM, sem OOM às 3 da manhã, sem pagar GPU parada de madrugada. A US$ 2,20 por milhão de tokens de saída, com cobrança por token e risco zero de ociosidade, o agregador ganha do nó próprio para quase todo mundo abaixo de volume industrial contínuo.

O formato prático em que a maioria dos times aterrissa: prototipar num endpoint gratuito com dado não sensível, migrar para um endpoint pago com treinamento desligado quando aparecerem usuários reais, e só reabrir a discussão de hospedagem própria quando a conformidade exigir ou quando o throughput sustentado estiver de fato na casa dos bilhões de tokens por mês. Meça o seu volume real na calculadora de tokens antes de supor de que lado dessa linha você está — a maioria superestima em uma ordem de grandeza, e quem não superestima já sabe disso.