개발자 영역으로 돌아가기

NVIDIA 모델

NVIDIA의 모든 4개 모델을 자세한 가격, 장단점 및 개발자 추천과 함께 살펴보세요.

4
모델
$0.050
최저 입력
1M
최대 컨텍스트
3
품질 등급

빠른 추천

최고 가성비: Nemotron-3-4B ($0.050/1M)
최고 품질: Nemotron-3-Ultra

Nemotron-3-Ultra

Flagship

에이전트 추론, 오케스트레이션, 복잡한 계획

공식 가격

사용 시기: 프론티어 에이전트 워크로드: 다단계 계획, 도구 오케스트레이션, 복잡한 추론 체인 및 프로덕션 에이전트 배포.

업그레이드 하이라이트

  • 550B MoE (55B 활성) — 개방형 프론티어 추론 모델
  • 하이브리드 Mamba-Transformer: 300+ tok/s, 1M 컨텍스트
  • 에이전트 오케스트레이션 및 도구 호출에 특화 설계
  • 오픈 가중치: NeMo, NIM 또는 자체 호스팅으로 배포
  • $0.50/1M 입력 — 오픈 모델 가격의 프론티어 성능
입력 가격
$0.500
per 1M tokens
출력 가격
$2.00
per 1M tokens
캐시된 입력
$0.130
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 1M
최대 출력: 32,768 tokens
지식 기준일: 2026-04
비전함수 호출파인튜닝JSON 모드무료 등급

장점

  • 550B 총 / 55B 활성 — 개방형 프론티어 추론
  • 하이브리드 Mamba-Transformer-MoE 아키텍처
  • 장기 에이전트 작업을 위한 1M 컨텍스트
  • 초당 300+ 토큰 처리량
  • NeMo 사용자 정의가 가능한 오픈 가중치

단점

  • 비전 지원 없음
  • 55B 활성 파라미터는 자체 호스팅에 상당한 컴퓨팅 필요
  • OpenAI/Anthropic 대비 작은 생태계

성능

출력 속도~90 tok/s
속도 제한5,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

MMLU
88.5%
MT-Bench
9.4
BFCL
78.2%
AgentBench
72.6%

Nemotron-3-Nano-Omni

Lite

멀티모달 에이전트, 비디오/오디오/이미지 이해, 엣지 배포

공식 가격

사용 시기: 실시간 비디오, 오디오 및 이미지 이해가 필요한 엣지에서의 멀티모달 AI 에이전트. 문서 인텔리전스, 화면 공유를 통한 고객 지원, 시청각 콘텐츠 분석.

업그레이드 하이라이트

  • 최초의 NVIDIA 옴니모델: 비전 + 오디오 + 언어 통합
  • 30B-A3B MoE — Jetson 및 DGX Spark에 배포 가능
  • 9배 처리량: 동일한 성능, 훨씬 적은 리소스
  • GUI 에이전트를 위한 네이티브 1080p 화면 추론
  • 오픈웨이트: NeMo로 도메인 작업에 맞게 커스터마이징
입력 가격
$0.100
per 1M tokens
출력 가격
$0.400
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 262K
최대 출력: 8,192 tokens
지식 기준일: 2026-04
비전함수 호출파인튜닝JSON 모드무료 등급

장점

  • 옴니모달: 비디오 + 오디오 + 이미지 + 텍스트를 하나의 모델로
  • 총 30B / 활성 3B — 25GB RAM에서 실행
  • 비교 가능한 오픈 옴니모델 대비 9배 처리량
  • 상업적 사용 권한이 있는 오픈웨이트
  • 네이티브 1920x1080 시각적 추론

단점

  • 활성 파라미터 3B로 복잡한 추론 제한
  • 최대 출력 8K
  • 더 작은 컨텍스트 윈도우 (256K)

성능

출력 속도~200 tok/s
속도 제한15,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

MMLU
71.2%
MMMU
65.8%
OSWorld
42.3%
DocVQA
92.1%

Nemotron-3-8B

Mid-tier

합성 데이터 생성, 보상 모델링

공식 가격

사용 시기: 합성 훈련 데이터 생성, RLHF를 위한 보상 모델링, NVIDIA 생태계 워크플로우에 적합합니다.

업그레이드 하이라이트

  • 합성 데이터 생성 전용 설계 — 다른 모델 훈련 가능
  • 강력한 보상 모델: GPT-4 판사보다 더 나은 응답 순위 지정
  • NVIDIA NIM 배포 — GPU에서 최적화된 추론
  • NeMo 프레임워크를 통한 파인튜닝
  • $0.10/1M 입력 — 대규모 데이터 생성에 비용 효율적
입력 가격
$0.100
per 1M tokens
출력 가격
$0.400
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 128K
최대 출력: 4,096 tokens
지식 기준일: 2025-03
비전함수 호출파인튜닝JSON 모드무료 등급

장점

  • 합성 데이터 생성에 최적화
  • 강력한 보상 모델 기능
  • NVIDIA 생태계 통합
  • 파인튜닝 지원

단점

  • 최대 출력 4K
  • 비전 미지원
  • 작은 모델 크기로 복잡한 작업 제한

성능

출력 속도~100 tok/s
속도 제한10,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

MMLU
73.8%
MT-Bench
8.2

Nemotron-3-4B

Lite

경량 합성 데이터, 엣지 배포

공식 가격

사용 시기: 엣지 배포, 경량 합성 데이터 생성 및 비용에 민감한 배치 처리.

업그레이드 하이라이트

  • 4B 파라미터 — Jetson 및 엣지 GPU에 배포
  • $0.05/1M 입력으로 합성 데이터 생성
  • NVIDIA NIM: 최적화된 컨테이너 배포
  • 오픈소스: 맞춤화를 위한 전체 가중치
입력 가격
$0.050
per 1M tokens
출력 가격
$0.200
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 128K
최대 출력: 4,096 tokens
지식 기준일: 2025-03
비전함수 호출파인튜닝JSON 모드무료 등급

장점

  • 컴팩트 4B — 엣지 GPU에서 실행
  • 합성 데이터 생성
  • NVIDIA NIM 최적화
  • 오픈소스 가중치

단점

  • 제한된 추론 능력
  • 최대 출력 4K
  • 비전 미지원

성능

출력 속도~180 tok/s
속도 제한20,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

MMLU
66.5%
MT-Bench
7.1

나란히 비교

모델등급입력출력컨텍스트
Nemotron-3-UltraFlagship$0.500$2.001M
Nemotron-3-Nano-OmniLite$0.100$0.400262K
Nemotron-3-8BMid-tier$0.100$0.400128K
Nemotron-3-4BLite$0.050$0.200128K