개발자 영역으로 돌아가기공식 가격 공식 가격 공식 가격 공식 가격
NVIDIA 모델
NVIDIA의 모든 4개 모델을 자세한 가격, 장단점 및 개발자 추천과 함께 살펴보세요.
4
모델
$0.050
최저 입력
1M
최대 컨텍스트
3
품질 등급
빠른 추천
최고 가성비: Nemotron-3-4B ($0.050/1M)
최고 품질: Nemotron-3-Ultra
Nemotron-3-Ultra
Flagship에이전트 추론, 오케스트레이션, 복잡한 계획
사용 시기: 프론티어 에이전트 워크로드: 다단계 계획, 도구 오케스트레이션, 복잡한 추론 체인 및 프로덕션 에이전트 배포.
업그레이드 하이라이트
- ◆550B MoE (55B 활성) — 개방형 프론티어 추론 모델
- ◆하이브리드 Mamba-Transformer: 300+ tok/s, 1M 컨텍스트
- ◆에이전트 오케스트레이션 및 도구 호출에 특화 설계
- ◆오픈 가중치: NeMo, NIM 또는 자체 호스팅으로 배포
- ◆$0.50/1M 입력 — 오픈 모델 가격의 프론티어 성능
입력 가격
$0.500
per 1M tokens
출력 가격
$2.00
per 1M tokens
캐시된 입력
$0.130
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 1M
최대 출력: 32,768 tokens
지식 기준일: 2026-04
비전함수 호출파인튜닝JSON 모드무료 등급
장점
- 550B 총 / 55B 활성 — 개방형 프론티어 추론
- 하이브리드 Mamba-Transformer-MoE 아키텍처
- 장기 에이전트 작업을 위한 1M 컨텍스트
- 초당 300+ 토큰 처리량
- NeMo 사용자 정의가 가능한 오픈 가중치
단점
- 비전 지원 없음
- 55B 활성 파라미터는 자체 호스팅에 상당한 컴퓨팅 필요
- OpenAI/Anthropic 대비 작은 생태계
성능
출력 속도~90 tok/s
속도 제한5,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
MMLU
88.5%
MT-Bench
9.4
BFCL
78.2%
AgentBench
72.6%
Nemotron-3-Nano-Omni
Lite멀티모달 에이전트, 비디오/오디오/이미지 이해, 엣지 배포
사용 시기: 실시간 비디오, 오디오 및 이미지 이해가 필요한 엣지에서의 멀티모달 AI 에이전트. 문서 인텔리전스, 화면 공유를 통한 고객 지원, 시청각 콘텐츠 분석.
업그레이드 하이라이트
- ◆최초의 NVIDIA 옴니모델: 비전 + 오디오 + 언어 통합
- ◆30B-A3B MoE — Jetson 및 DGX Spark에 배포 가능
- ◆9배 처리량: 동일한 성능, 훨씬 적은 리소스
- ◆GUI 에이전트를 위한 네이티브 1080p 화면 추론
- ◆오픈웨이트: NeMo로 도메인 작업에 맞게 커스터마이징
입력 가격
$0.100
per 1M tokens
출력 가격
$0.400
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 262K
최대 출력: 8,192 tokens
지식 기준일: 2026-04
비전함수 호출파인튜닝JSON 모드무료 등급
장점
- 옴니모달: 비디오 + 오디오 + 이미지 + 텍스트를 하나의 모델로
- 총 30B / 활성 3B — 25GB RAM에서 실행
- 비교 가능한 오픈 옴니모델 대비 9배 처리량
- 상업적 사용 권한이 있는 오픈웨이트
- 네이티브 1920x1080 시각적 추론
단점
- 활성 파라미터 3B로 복잡한 추론 제한
- 최대 출력 8K
- 더 작은 컨텍스트 윈도우 (256K)
성능
출력 속도~200 tok/s
속도 제한15,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
MMLU
71.2%
MMMU
65.8%
OSWorld
42.3%
DocVQA
92.1%
Nemotron-3-8B
Mid-tier합성 데이터 생성, 보상 모델링
사용 시기: 합성 훈련 데이터 생성, RLHF를 위한 보상 모델링, NVIDIA 생태계 워크플로우에 적합합니다.
업그레이드 하이라이트
- ◆합성 데이터 생성 전용 설계 — 다른 모델 훈련 가능
- ◆강력한 보상 모델: GPT-4 판사보다 더 나은 응답 순위 지정
- ◆NVIDIA NIM 배포 — GPU에서 최적화된 추론
- ◆NeMo 프레임워크를 통한 파인튜닝
- ◆$0.10/1M 입력 — 대규모 데이터 생성에 비용 효율적
입력 가격
$0.100
per 1M tokens
출력 가격
$0.400
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 128K
최대 출력: 4,096 tokens
지식 기준일: 2025-03
비전함수 호출파인튜닝JSON 모드무료 등급
장점
- 합성 데이터 생성에 최적화
- 강력한 보상 모델 기능
- NVIDIA 생태계 통합
- 파인튜닝 지원
단점
- 최대 출력 4K
- 비전 미지원
- 작은 모델 크기로 복잡한 작업 제한
성능
출력 속도~100 tok/s
속도 제한10,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
MMLU
73.8%
MT-Bench
8.2
Nemotron-3-4B
Lite경량 합성 데이터, 엣지 배포
사용 시기: 엣지 배포, 경량 합성 데이터 생성 및 비용에 민감한 배치 처리.
업그레이드 하이라이트
- ◆4B 파라미터 — Jetson 및 엣지 GPU에 배포
- ◆$0.05/1M 입력으로 합성 데이터 생성
- ◆NVIDIA NIM: 최적화된 컨테이너 배포
- ◆오픈소스: 맞춤화를 위한 전체 가중치
입력 가격
$0.050
per 1M tokens
출력 가격
$0.200
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 128K
최대 출력: 4,096 tokens
지식 기준일: 2025-03
비전함수 호출파인튜닝JSON 모드무료 등급
장점
- 컴팩트 4B — 엣지 GPU에서 실행
- 합성 데이터 생성
- NVIDIA NIM 최적화
- 오픈소스 가중치
단점
- 제한된 추론 능력
- 최대 출력 4K
- 비전 미지원
성능
출력 속도~180 tok/s
속도 제한20,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
MMLU
66.5%
MT-Bench
7.1
나란히 비교
| 모델 | 등급 | 입력 | 출력 | 컨텍스트 |
|---|---|---|---|---|
| Nemotron-3-Ultra | Flagship | $0.500 | $2.00 | 1M |
| Nemotron-3-Nano-Omni | Lite | $0.100 | $0.400 | 262K |
| Nemotron-3-8B | Mid-tier | $0.100 | $0.400 | 128K |
| Nemotron-3-4B | Lite | $0.050 | $0.200 | 128K |