返回开发者专区官方定价 官方定价 官方定价 官方定价
NVIDIA 模型
探索 NVIDIA 的所有 4 个模型,包括详细定价、优缺点和开发者推荐。
4
模型
$0.050
最低输入价格
1M
最大上下文
3
质量层级
快速推荐
最佳性价比: Nemotron-3-4B ($0.050/1M)
最佳质量: Nemotron-3-Ultra
Nemotron-3-Ultra
Flagship智能推理、编排、复杂规划
适用场景: 前沿智能体工作负载:多步骤规划、工具编排、复杂推理链以及生产级智能体部署。
核心升级
- ◆550B MoE,55B激活参数——开放前沿推理模型
- ◆混合Mamba-Transformer:300+ tok/s,1M上下文
- ◆专为智能体编排和工具调用设计
- ◆开放权重:使用NeMo、NIM或自托管部署
- ◆$0.50/1M输入——以开放模型价格提供前沿能力
输入价格
$0.500
per 1M tokens
输出价格
$2.00
per 1M tokens
缓存输入
$0.130
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 1M
最大输出: 32,768 tokens
知识截止日期: 2026-04
视觉函数调用微调JSON 模式免费层级
优点
- 550B总参数/55B激活参数——开放前沿推理
- 混合Mamba-Transformer-MoE架构
- 1M上下文,适用于长期智能体任务
- 300+ tokens/秒吞吐量
- 开放权重,支持NeMo定制
缺点
- 不支持视觉
- 55B激活参数仍需大量计算资源用于自托管
- 生态系统较OpenAI/Anthropic更小
性能
输出速度~90 tok/s
速率限制5,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
MMLU
88.5%
MT-Bench
9.4
BFCL
78.2%
AgentBench
72.6%
Nemotron-3-Nano-Omni
Lite多模态代理、视频/音频/图像理解、边缘部署
适用场景: 需要实时视频、音频和图像理解的多模态AI代理,适用于边缘部署。文档智能、带屏幕共享的客户支持以及音视频内容分析。
核心升级
- ◆首个NVIDIA全模态模型:视觉+音频+语言统一
- ◆30B-A3B MoE架构——可部署于Jetson和DGX Spark
- ◆9倍吞吐量:相同性能,资源消耗大幅降低
- ◆原生1080p屏幕推理,适用于GUI代理
- ◆开放权重:使用NeMo进行领域任务定制
输入价格
$0.100
per 1M tokens
输出价格
$0.400
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 262K
最大输出: 8,192 tokens
知识截止日期: 2026-04
视觉函数调用微调JSON 模式免费层级
优点
- 全模态:视频+音频+图像+文本集成于一个模型
- 30B总参数量/3B激活参数——可在25GB内存上运行
- 吞吐量是同类开源全模态模型的9倍
- 开放权重,可商用
- 原生1920x1080视觉推理
缺点
- 3B激活参数限制了复杂推理能力
- 最大输出8K
- 上下文窗口较小(256K)
性能
输出速度~200 tok/s
速率限制15,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
MMLU
71.2%
MMMU
65.8%
OSWorld
42.3%
DocVQA
92.1%
Nemotron-3-8B
Mid-tier合成数据生成、奖励建模
适用场景: 生成合成训练数据、用于RLHF的奖励建模以及NVIDIA生态系统工作流程。
核心升级
- ◆专为合成数据生成而设计——训练其他模型
- ◆强大的奖励模型:比GPT-4评判器更好地对响应进行排名
- ◆NVIDIA NIM部署——在GPU上优化推理
- ◆使用NeMo框架进行微调
- ◆$0.10/1M输入——大规模数据生成的经济高效选择
输入价格
$0.100
per 1M tokens
输出价格
$0.400
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 128K
最大输出: 4,096 tokens
知识截止日期: 2025-03
视觉函数调用微调JSON 模式免费层级
优点
- 针对合成数据生成进行了优化
- 强大的奖励模型能力
- NVIDIA生态系统集成
- 微调支持
缺点
- 最大输出4K
- 无视觉功能
- 较小的模型尺寸限制了复杂任务
性能
输出速度~100 tok/s
速率限制10,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
MMLU
73.8%
MT-Bench
8.2
Nemotron-3-4B
Lite轻量级合成数据,边缘部署
适用场景: 边缘部署、轻量级合成数据生成以及对成本敏感的批量处理。
核心升级
- ◆4B参数——部署在Jetson和边缘GPU上
- ◆合成数据生成,每100万输入仅需0.05美元
- ◆NVIDIA NIM:优化的容器化部署
- ◆开源:完整权重可自定义
输入价格
$0.050
per 1M tokens
输出价格
$0.200
per 1M tokens
缓存输入
—
per 1M tokens
批量输入
—
per 1M tokens
上下文窗口: 128K
最大输出: 4,096 tokens
知识截止日期: 2025-03
视觉函数调用微调JSON 模式免费层级
优点
- 紧凑型4B——可在边缘GPU上运行
- 合成数据生成
- 针对NVIDIA NIM优化
- 开源权重
缺点
- 推理能力有限
- 最大输出4K
- 无视觉功能
性能
输出速度~180 tok/s
速率限制20,000 RPM
多模态能力
图像输入图像输出音频输入音频输出
基准测试
MMLU
66.5%
MT-Bench
7.1
并排比较
| 模型 | 层级 | 输入 | 输出 | 上下文 |
|---|---|---|---|---|
| Nemotron-3-Ultra | Flagship | $0.500 | $2.00 | 1M |
| Nemotron-3-Nano-Omni | Lite | $0.100 | $0.400 | 262K |
| Nemotron-3-8B | Mid-tier | $0.100 | $0.400 | 128K |
| Nemotron-3-4B | Lite | $0.050 | $0.200 | 128K |