Voltar à Zona do Desenvolvedor

NVIDIA Modelos

Explore todos os 4 modelos de NVIDIA com preços detalhados, prós e contras e recomendações para desenvolvedores.

4
Modelos
$0.050
Menor Entrada
1M
Contexto Máximo
3
Níveis de Qualidade

Recomendações Rápidas

Melhor Custo-Benefício: Nemotron-3-4B ($0.050/1M)
Melhor Qualidade: Nemotron-3-Ultra

Nemotron-3-Ultra

Flagship

Raciocínio agentivo, orquestração, planejamento complexo

Preços Oficiais

Quando usar: Cargas de trabalho agentivas de fronteira: planejamento em várias etapas, orquestração de ferramentas, cadeias de raciocínio complexas e implantação de agentes em produção.

Destaques da Atualização

  • 550B MoE com 55B ativos — modelo de raciocínio de fronteira aberto
  • Mamba-Transformer híbrido: 300+ tok/s, contexto de 1M
  • Projetado especificamente para orquestração agentiva e chamada de ferramentas
  • Peso aberto: implante com NeMo, NIM ou auto-hospedado
  • $0.50/1M entrada — capacidade de fronteira a preço de modelo aberto
Preço de Entrada
$0.500
per 1M tokens
Preço de Saída
$2.00
per 1M tokens
Entrada em Cache
$0.130
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 1M
Saída Máxima: 32,768 tokens
Corte de Conhecimento: 2026-04
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • 550B total / 55B ativos — raciocínio de fronteira aberto
  • Arquitetura híbrida Mamba-Transformer-MoE
  • Contexto de 1M para tarefas de agente de longo horizonte
  • Taxa de transferência de 300+ tokens/seg
  • Peso aberto com personalização NeMo

Contras

  • Sem suporte para visão
  • 55B parâmetros ativos ainda requerem computação significativa para auto-hospedagem
  • Ecossistema menor em comparação com OpenAI/Anthropic

Desempenho

Velocidade de saída~90 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
88.5%
MT-Bench
9.4
BFCL
78.2%
AgentBench
72.6%

Nemotron-3-Nano-Omni

Lite

Agentes multimodais, compreensão de vídeo/áudio/imagem, implantação na borda

Preços Oficiais

Quando usar: Agentes de IA multimodais que precisam de compreensão em tempo real de vídeo, áudio e imagem na borda. Inteligência documental, suporte ao cliente com compartilhamento de tela e análise de conteúdo audiovisual.

Destaques da Atualização

  • Primeiro modelo omni da NVIDIA: visão + áudio + linguagem unificados
  • 30B-A3B MoE — implanta em Jetson e DGX Spark
  • 9x de throughput: mesmo desempenho, muito menos recursos
  • Raciocínio nativo em tela 1080p para agentes GUI
  • Peso aberto: personalize com NeMo para tarefas de domínio
Preço de Entrada
$0.100
per 1M tokens
Preço de Saída
$0.400
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 262K
Saída Máxima: 8,192 tokens
Corte de Conhecimento: 2026-04
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Omni-modal: vídeo + áudio + imagem + texto em um único modelo
  • 30B total / 3B ativos — roda em 25 GB de RAM
  • 9x de throughput em comparação com modelos omni abertos similares
  • Peso aberto com direitos de uso comercial
  • Raciocínio visual nativo em 1920x1080

Contras

  • 3B parâmetros ativos limitam raciocínio complexo
  • Máximo de 8K de saída
  • Janela de contexto menor (256K)

Desempenho

Velocidade de saída~200 tok/s
Limite de taxa15,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
71.2%
MMMU
65.8%
OSWorld
42.3%
DocVQA
92.1%

Nemotron-3-8B

Mid-tier

Geração de dados sintéticos, modelagem de recompensa

Preços Oficiais

Quando usar: Gerar dados sintéticos de treinamento, modelagem de recompensa para RLHF e fluxos de trabalho do ecossistema NVIDIA.

Destaques da Atualização

  • Projetado especificamente para geração de dados sintéticos — treinar outros modelos
  • Modelo de recompensa forte: classifica respostas melhor que o juiz GPT-4
  • Implantação NVIDIA NIM — inferência otimizada em GPUs
  • Ajuste fino com framework NeMo
  • $0,10/1M de entrada — econômico para geração de dados em escala
Preço de Entrada
$0.100
per 1M tokens
Preço de Saída
$0.400
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 128K
Saída Máxima: 4,096 tokens
Corte de Conhecimento: 2025-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Otimizado para geração de dados sintéticos
  • Capacidades robustas de modelo de recompensa
  • Integração com ecossistema NVIDIA
  • Suporte para ajuste fino

Contras

  • Saída máxima de 4K
  • Sem visão
  • Tamanho menor do modelo limita tarefas complexas

Desempenho

Velocidade de saída~100 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
73.8%
MT-Bench
8.2

Nemotron-3-4B

Lite

Dados sintéticos leves, implantação na borda

Preços Oficiais

Quando usar: Implantação na borda, geração leve de dados sintéticos e processamento em lote sensível a custos.

Destaques da Atualização

  • 4B parâmetros — implanta em Jetson e GPUs de borda
  • Geração de dados sintéticos a $0,05/1M de entrada
  • NVIDIA NIM: implantação conteinerizada otimizada
  • Código aberto: pesos completos para personalização
Preço de Entrada
$0.050
per 1M tokens
Preço de Saída
$0.200
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 128K
Saída Máxima: 4,096 tokens
Corte de Conhecimento: 2025-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Compacto 4B — roda em GPUs de borda
  • Geração de dados sintéticos
  • Otimizado para NVIDIA NIM
  • Pesos de código aberto

Contras

  • Capacidade de raciocínio limitada
  • Saída máxima de 4K
  • Sem visão

Desempenho

Velocidade de saída~180 tok/s
Limite de taxa20,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MMLU
66.5%
MT-Bench
7.1

Comparação Lado a Lado

ModeloNívelEntradaSaídaContexto
Nemotron-3-UltraFlagship$0.500$2.001M
Nemotron-3-Nano-OmniLite$0.100$0.400262K
Nemotron-3-8BMid-tier$0.100$0.400128K
Nemotron-3-4BLite$0.050$0.200128K