Zurück zur Entwicklerzone

NVIDIA Modelle

Entdecken Sie alle 4 Modelle von NVIDIA mit detaillierten Preisen, Vor- und Nachteilen sowie Entwicklerempfehlungen.

4
Modelle
$0.050
Niedrigster Input
1M
Max. Kontext
3
Qualitätsstufen

Schnellempfehlungen

Bestes Preis-Leistungs-Verhältnis: Nemotron-3-4B ($0.050/1M)
Beste Qualität: Nemotron-3-Ultra

Nemotron-3-Ultra

Flagship

Agentisches Denken, Orchestrierung, komplexe Planung

Offizielle Preise

Wann verwenden: Grenzagentische Arbeitslasten: mehrstufige Planung, Werkzeugorchestrierung, komplexe Denkketten und Produktionsagenteneinsatz.

Upgrade-Highlights

  • 550B MoE mit 55B aktiv — offenes Grenzdenkmodell
  • Hybrider Mamba-Transformer: 300+ tok/s, 1M Kontext
  • Speziell für agentische Orchestrierung und Werkzeugaufrufe entwickelt
  • Offene Gewichte: Bereitstellung mit NeMo, NIM oder selbst gehostet
  • $0.50/1M Eingabe — Grenzfähigkeit zu Open-Modell-Preisen
Input-Preis
$0.500
per 1M tokens
Output-Preis
$2.00
per 1M tokens
Cached Input
$0.130
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 1M
Max. Output: 32,768 tokens
Wissensstand: 2026-04
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • 550B gesamt / 55B aktiv — offenes Grenzdenken
  • Hybride Mamba-Transformer-MoE-Architektur
  • 1M Kontext für langfristige Agentenaufgaben
  • 300+ Tokens/Sekunde Durchsatz
  • Offene Gewichte mit NeMo-Anpassung

Nachteile

  • Keine Bildunterstützung
  • 55B aktive Parameter erfordern immer noch erhebliche Rechenleistung für Selbsthosting
  • Kleineres Ökosystem im Vergleich zu OpenAI/Anthropic

Leistung

Ausgabegeschwindigkeit~90 tok/s
Rate-Limit5,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
88.5%
MT-Bench
9.4
BFCL
78.2%
AgentBench
72.6%

Nemotron-3-Nano-Omni

Lite

Multimodale Agenten, Video-/Audio-/Bildverständnis, Edge-Bereitstellung

Offizielle Preise

Wann verwenden: Multimodale KI-Agenten, die Echtzeit-Video-, Audio- und Bildverständnis am Edge benötigen. Dokumentenintelligenz, Kundensupport mit Bildschirmfreigabe und audiovisuelle Inhaltsanalyse.

Upgrade-Highlights

  • Erstes NVIDIA-Omni-Modell: Vision + Audio + Sprache vereint
  • 30B-A3B MoE — einsetzbar auf Jetson und DGX Spark
  • 9x Durchsatz: gleiche Leistung, weit weniger Ressourcen
  • Natives 1080p-Bildschirmdenken für GUI-Agenten
  • Offenes Gewicht: mit NeMo für Domänenaufgaben anpassen
Input-Preis
$0.100
per 1M tokens
Output-Preis
$0.400
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 262K
Max. Output: 8,192 tokens
Wissensstand: 2026-04
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Omni-modal: Video + Audio + Bild + Text in einem Modell
  • 30B gesamt / 3B aktiv — läuft auf 25 GB RAM
  • 9x Durchsatz im Vergleich zu vergleichbaren offenen Omni-Modellen
  • Offenes Gewicht mit kommerziellen Nutzungsrechten
  • Natives 1920x1080 visuelles Denken

Nachteile

  • 3B aktive Parameter schränken komplexes Denken ein
  • Maximal 8K Ausgabe
  • Kleineres Kontextfenster (256K)

Leistung

Ausgabegeschwindigkeit~200 tok/s
Rate-Limit15,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
71.2%
MMMU
65.8%
OSWorld
42.3%
DocVQA
92.1%

Nemotron-3-8B

Mid-tier

Synthetische Datengenerierung, Belohnungsmodellierung

Offizielle Preise

Wann verwenden: Generierung synthetischer Trainingsdaten, Belohnungsmodellierung für RLHF und Workflows im NVIDIA-Ökosystem.

Upgrade-Highlights

  • Speziell für synthetische Datengenerierung entwickelt — andere Modelle trainieren
  • Starkes Belohnungsmodell: bewertet Antworten besser als GPT-4-Richter
  • NVIDIA NIM-Bereitstellung — optimierte Inferenz auf GPUs
  • Feintuning mit NeMo-Framework
  • $0,10/1M Eingabe — kosteneffizient für Datengenerierung in großem Maßstab
Input-Preis
$0.100
per 1M tokens
Output-Preis
$0.400
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 128K
Max. Output: 4,096 tokens
Wissensstand: 2025-03
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Optimiert für synthetische Datengenerierung
  • Starke Belohnungsmodell-Fähigkeiten
  • Integration in das NVIDIA-Ökosystem
  • Unterstützung für Feintuning

Nachteile

  • Maximale Ausgabe von 4K
  • Keine Bildverarbeitung
  • Kleinere Modellgröße schränkt komplexe Aufgaben ein

Leistung

Ausgabegeschwindigkeit~100 tok/s
Rate-Limit10,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
73.8%
MT-Bench
8.2

Nemotron-3-4B

Lite

Leichte synthetische Daten, Edge-Bereitstellung

Offizielle Preise

Wann verwenden: Edge-Bereitstellung, leichte synthetische Datengenerierung und kostenbewusste Stapelverarbeitung.

Upgrade-Highlights

  • 4B Parameter — Bereitstellung auf Jetson und Edge-GPUs
  • Synthetische Datengenerierung für $0,05/1M Eingabe
  • NVIDIA NIM: optimierte containerisierte Bereitstellung
  • Open-Source: vollständige Gewichte für Anpassung
Input-Preis
$0.050
per 1M tokens
Output-Preis
$0.200
per 1M tokens
Cached Input
per 1M tokens
Batch-Input
per 1M tokens
Kontextfenster: 128K
Max. Output: 4,096 tokens
Wissensstand: 2025-03
VisionFunktionsaufrufFeinabstimmungJSON-ModusKostenlose Stufe

Vorteile

  • Kompakt 4B — läuft auf Edge-GPUs
  • Synthetische Datengenerierung
  • NVIDIA NIM optimiert
  • Open-Source-Gewichte

Nachteile

  • Begrenzte Argumentationsfähigkeit
  • 4K maximale Ausgabe
  • Keine Bildverarbeitung

Leistung

Ausgabegeschwindigkeit~180 tok/s
Rate-Limit20,000 RPM

Multimodal

BildeingabeBildausgabeAudioeingabeAudioausgabe

Benchmarks

MMLU
66.5%
MT-Bench
7.1

Nebeneinander-Vergleich

ModellStufeInputOutputKontext
Nemotron-3-UltraFlagship$0.500$2.001M
Nemotron-3-Nano-OmniLite$0.100$0.400262K
Nemotron-3-8BMid-tier$0.100$0.400128K
Nemotron-3-4BLite$0.050$0.200128K