開発者ゾーンに戻る

NVIDIA モデル

NVIDIA の全 4 モデルを、詳細な価格、長所・短所、開発者向け推奨事項とともにご覧いただけます。

4
モデル
$0.050
最安入力
1M
最大コンテキスト
3
品質ティア

クイック推奨

ベストバリュー: Nemotron-3-4B ($0.050/1M)
最高品質: Nemotron-3-Ultra

Nemotron-3-Ultra

Flagship

エージェント推論、オーケストレーション、複雑な計画

公式価格

使用するタイミング: フロンティアエージェントワークロード: マルチステップ計画、ツールオーケストレーション、複雑な推論チェーン、プロダクションエージェント展開。

アップグレードのポイント

  • 550B MoE (55Bアクティブ) — オープンフロンティア推論モデル
  • ハイブリッドMamba-Transformer: 300+ tok/s、1Mコンテキスト
  • エージェントオーケストレーションとツール呼び出しに特化
  • オープンウェイト: NeMo、NIM、またはセルフホスティングで展開
  • $0.50/1M入力 — オープンモデル価格でフロンティア性能
入力価格
$0.500
per 1M tokens
出力価格
$2.00
per 1M tokens
キャッシュ入力
$0.130
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 1M
最大出力: 32,768 tokens
知識のカットオフ: 2026-04
ビジョン関数呼び出しファインチューニングJSONモード無料ティア

長所

  • 550B総/55Bアクティブ — オープンフロンティア推論
  • ハイブリッドMamba-Transformer-MoEアーキテクチャ
  • 長期エージェントタスク向け1Mコンテキスト
  • 毎秒300+トークンのスループット
  • NeMoカスタマイズ可能なオープンウェイト

短所

  • ビジョン非対応
  • 55Bアクティブパラメータはセルフホスティングにかなりの計算リソースが必要
  • OpenAI/Anthropicと比較して小規模なエコシステム

パフォーマンス

出力速度~90 tok/s
レート制限5,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

MMLU
88.5%
MT-Bench
9.4
BFCL
78.2%
AgentBench
72.6%

Nemotron-3-Nano-Omni

Lite

マルチモーダルエージェント、動画/音声/画像理解、エッジ展開

公式価格

使用するタイミング: エッジでのリアルタイム動画、音声、画像理解を必要とするマルチモーダルAIエージェント。ドキュメントインテリジェンス、画面共有によるカスタマーサポート、視聴覚コンテンツ分析。

アップグレードのポイント

  • 初のNVIDIAオムニモデル: ビジョン + 音声 + 言語を統合
  • 30B-A3B MoE — JetsonおよびDGX Sparkに展開可能
  • 9倍のスループット: 同じパフォーマンスでより少ないリソース
  • GUIエージェント向けネイティブ1080p画面推論
  • オープンウェイト: NeMoでドメインタスクにカスタマイズ
入力価格
$0.100
per 1M tokens
出力価格
$0.400
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 262K
最大出力: 8,192 tokens
知識のカットオフ: 2026-04
ビジョン関数呼び出しファインチューニングJSONモード無料ティア

長所

  • オムニモーダル: 動画 + 音声 + 画像 + テキストを1つのモデルで
  • 合計30B / アクティブ3B — 25GB RAMで動作
  • 同等のオープンオムニモデルと比較して9倍のスループット
  • 商用利用権付きのオープンウェイト
  • ネイティブ1920x1080の視覚的推論

短所

  • アクティブパラメータ3Bにより複雑な推論が制限される
  • 最大出力8K
  • より小さいコンテキストウィンドウ (256K)

パフォーマンス

出力速度~200 tok/s
レート制限15,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

MMLU
71.2%
MMMU
65.8%
OSWorld
42.3%
DocVQA
92.1%

Nemotron-3-8B

Mid-tier

合成データ生成、報酬モデリング

公式価格

使用するタイミング: 合成トレーニングデータの生成、RLHFのための報酬モデリング、NVIDIAエコシステムのワークフローに適しています。

アップグレードのポイント

  • 合成データ生成専用設計 — 他のモデルをトレーニング可能
  • 強力な報酬モデル: GPT-4ジャッジよりも優れた応答ランキング
  • NVIDIA NIMデプロイメント — GPU上で最適化された推論
  • NeMoフレームワークによるファインチューニング
  • $0.10/1M入力 — 大規模データ生成にコスト効率が高い
入力価格
$0.100
per 1M tokens
出力価格
$0.400
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 128K
最大出力: 4,096 tokens
知識のカットオフ: 2025-03
ビジョン関数呼び出しファインチューニングJSONモード無料ティア

長所

  • 合成データ生成に最適化
  • 強力な報酬モデル機能
  • NVIDIAエコシステムとの統合
  • ファインチューニング対応

短所

  • 最大出力4K
  • ビジョン非対応
  • モデルサイズが小さいため複雑なタスクに制限

パフォーマンス

出力速度~100 tok/s
レート制限10,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

MMLU
73.8%
MT-Bench
8.2

Nemotron-3-4B

Lite

軽量合成データ、エッジ展開

公式価格

使用するタイミング: エッジ展開、軽量合成データ生成、コスト重視のバッチ処理。

アップグレードのポイント

  • 4Bパラメータ — JetsonおよびエッジGPUに展開
  • $0.05/1M入力で合成データ生成
  • NVIDIA NIM: 最適化されたコンテナ展開
  • オープンソース: カスタマイズ用の全ウェイト
入力価格
$0.050
per 1M tokens
出力価格
$0.200
per 1M tokens
キャッシュ入力
per 1M tokens
バッチ入力
per 1M tokens
コンテキストウィンドウ: 128K
最大出力: 4,096 tokens
知識のカットオフ: 2025-03
ビジョン関数呼び出しファインチューニングJSONモード無料ティア

長所

  • コンパクト4B — エッジGPUで実行
  • 合成データ生成
  • NVIDIA NIM最適化
  • オープンソースウェイト

短所

  • 限られた推論能力
  • 最大出力4K
  • ビジョン非対応

パフォーマンス

出力速度~180 tok/s
レート制限20,000 RPM

マルチモーダル

画像入力画像出力音声入力音声出力

ベンチマーク

MMLU
66.5%
MT-Bench
7.1

並べて比較

モデルティア入力出力コンテキスト
Nemotron-3-UltraFlagship$0.500$2.001M
Nemotron-3-Nano-OmniLite$0.100$0.400262K
Nemotron-3-8BMid-tier$0.100$0.400128K
Nemotron-3-4BLite$0.050$0.200128K