返回开发者专区

NVIDIA 模型

探索 NVIDIA 的所有 4 个模型,包括详细定价、优缺点和开发者推荐。

4
模型
$0.050
最低输入价格
1M
最大上下文
3
质量层级

快速推荐

最佳性价比: Nemotron-3-4B ($0.050/1M)
最佳质量: Nemotron-3-Ultra

Nemotron-3-Ultra

Flagship

智能推理、编排、复杂规划

官方定价

适用场景: 前沿智能体工作负载:多步骤规划、工具编排、复杂推理链以及生产级智能体部署。

核心升级

  • 550B MoE,55B激活参数——开放前沿推理模型
  • 混合Mamba-Transformer:300+ tok/s,1M上下文
  • 专为智能体编排和工具调用设计
  • 开放权重:使用NeMo、NIM或自托管部署
  • $0.50/1M输入——以开放模型价格提供前沿能力
输入价格
$0.500
per 1M tokens
输出价格
$2.00
per 1M tokens
缓存输入
$0.130
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 1M
最大输出: 32,768 tokens
知识截止日期: 2026-04
视觉函数调用微调JSON 模式免费层级

优点

  • 550B总参数/55B激活参数——开放前沿推理
  • 混合Mamba-Transformer-MoE架构
  • 1M上下文,适用于长期智能体任务
  • 300+ tokens/秒吞吐量
  • 开放权重,支持NeMo定制

缺点

  • 不支持视觉
  • 55B激活参数仍需大量计算资源用于自托管
  • 生态系统较OpenAI/Anthropic更小

性能

输出速度~90 tok/s
速率限制5,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
88.5%
MT-Bench
9.4
BFCL
78.2%
AgentBench
72.6%

Nemotron-3-Nano-Omni

Lite

多模态代理、视频/音频/图像理解、边缘部署

官方定价

适用场景: 需要实时视频、音频和图像理解的多模态AI代理,适用于边缘部署。文档智能、带屏幕共享的客户支持以及音视频内容分析。

核心升级

  • 首个NVIDIA全模态模型:视觉+音频+语言统一
  • 30B-A3B MoE架构——可部署于Jetson和DGX Spark
  • 9倍吞吐量:相同性能,资源消耗大幅降低
  • 原生1080p屏幕推理,适用于GUI代理
  • 开放权重:使用NeMo进行领域任务定制
输入价格
$0.100
per 1M tokens
输出价格
$0.400
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 262K
最大输出: 8,192 tokens
知识截止日期: 2026-04
视觉函数调用微调JSON 模式免费层级

优点

  • 全模态:视频+音频+图像+文本集成于一个模型
  • 30B总参数量/3B激活参数——可在25GB内存上运行
  • 吞吐量是同类开源全模态模型的9倍
  • 开放权重,可商用
  • 原生1920x1080视觉推理

缺点

  • 3B激活参数限制了复杂推理能力
  • 最大输出8K
  • 上下文窗口较小(256K)

性能

输出速度~200 tok/s
速率限制15,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
71.2%
MMMU
65.8%
OSWorld
42.3%
DocVQA
92.1%

Nemotron-3-8B

Mid-tier

合成数据生成、奖励建模

官方定价

适用场景: 生成合成训练数据、用于RLHF的奖励建模以及NVIDIA生态系统工作流程。

核心升级

  • 专为合成数据生成而设计——训练其他模型
  • 强大的奖励模型:比GPT-4评判器更好地对响应进行排名
  • NVIDIA NIM部署——在GPU上优化推理
  • 使用NeMo框架进行微调
  • $0.10/1M输入——大规模数据生成的经济高效选择
输入价格
$0.100
per 1M tokens
输出价格
$0.400
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 128K
最大输出: 4,096 tokens
知识截止日期: 2025-03
视觉函数调用微调JSON 模式免费层级

优点

  • 针对合成数据生成进行了优化
  • 强大的奖励模型能力
  • NVIDIA生态系统集成
  • 微调支持

缺点

  • 最大输出4K
  • 无视觉功能
  • 较小的模型尺寸限制了复杂任务

性能

输出速度~100 tok/s
速率限制10,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
73.8%
MT-Bench
8.2

Nemotron-3-4B

Lite

轻量级合成数据,边缘部署

官方定价

适用场景: 边缘部署、轻量级合成数据生成以及对成本敏感的批量处理。

核心升级

  • 4B参数——部署在Jetson和边缘GPU上
  • 合成数据生成,每100万输入仅需0.05美元
  • NVIDIA NIM:优化的容器化部署
  • 开源:完整权重可自定义
输入价格
$0.050
per 1M tokens
输出价格
$0.200
per 1M tokens
缓存输入
per 1M tokens
批量输入
per 1M tokens
上下文窗口: 128K
最大输出: 4,096 tokens
知识截止日期: 2025-03
视觉函数调用微调JSON 模式免费层级

优点

  • 紧凑型4B——可在边缘GPU上运行
  • 合成数据生成
  • 针对NVIDIA NIM优化
  • 开源权重

缺点

  • 推理能力有限
  • 最大输出4K
  • 无视觉功能

性能

输出速度~180 tok/s
速率限制20,000 RPM

多模态能力

图像输入图像输出音频输入音频输出

基准测试

MMLU
66.5%
MT-Bench
7.1

并排比较

模型层级输入输出上下文
Nemotron-3-UltraFlagship$0.500$2.001M
Nemotron-3-Nano-OmniLite$0.100$0.400262K
Nemotron-3-8BMid-tier$0.100$0.400128K
Nemotron-3-4BLite$0.050$0.200128K