개발자 영역으로 돌아가기공식 가격 공식 가격 공식 가격 공식 가격 공식 가격 공식 가격 공식 가격
Microsoft 모델
Microsoft의 모든 7개 모델을 자세한 가격, 장단점 및 개발자 추천과 함께 살펴보세요.
7
모델
$0.360
최저 입력
262K
최대 컨텍스트
4
품질 등급
빠른 추천
최고 가성비: MAI-Transcribe-1.5 ($0.360/1M)
최고 품질: MAI-Image-2.5
추론에 최적: MAI-Thinking-1
MAI-Thinking-1
Reasoning복잡한 추론, 수학, 에이전트 코딩
사용 시기: 정확성이 속도보다 중요한 복잡한 다단계 추론, 수학 문제 및 에이전트 코딩에 사용합니다.
업그레이드 하이라이트
- ◆~1T 총 파라미터, 35B 활성 MoE — 중간급에서 경쟁력 있음
- ◆AIME 2025: 97.0%, AIME 2026: 94.5% — 고급 수학 추론
- ◆SWE-bench Pro: Claude Opus 4.6과 경쟁력 있음
- ◆실시간 추론을 위한 o3보다 빠른 첫 토큰 지연 시간
- ◆깨끗하고 추적 가능한 엔터프라이즈급 데이터 — 증류 없음
입력 가격
$5.00
per 1M tokens
출력 가격
$20.00
per 1M tokens
캐시된 입력
$1.00
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 262K
최대 출력: 32,000 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드
장점
- 35B 활성 / ~1T 총 파라미터 — 동급 대비 강력함
- AIME 2025: 97.0%, AIME 2026: 94.5% — 최고 수준의 수학 추론
- 증류 없음 — 깨끗한 데이터로 처음부터 학습
- 블라인드 인간 평가에서 Sonnet 4.6보다 선호됨
단점
- 아직 비전 지원 없음
- 신규 모델 — 제한된 독립 벤치마크
- Azure 중심 가용성
- 비추론 모델보다 높은 비용
성능
출력 속도~55 tok/s
속도 제한3,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%
MAI-Code-1-Flash
Lite빠른 에이전트 코딩, IDE 통합
사용 시기: IDE 환경에서 빠른 코드 완성, 인라인 제안 및 일상적인 코딩 지원에 가장 적합합니다.
업그레이드 하이라이트
- ◆5B 활성 파라미터 — Haiku와 유사하지만 60% 저렴
- ◆$0.75/M 입력 — 시장에서 가장 저렴한 코딩 모델
- ◆작업당 60% 적은 토큰 — 추론 효율적 설계
- ◆네이티브 GitHub Copilot 및 VS Code 통합
- ◆HumanEval: 92%+ — 이 크기에서 강력한 코딩 정확도
입력 가격
$0.750
per 1M tokens
출력 가격
$3.00
per 1M tokens
캐시된 입력
$0.150
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 131K
최대 출력: 16,384 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드무료 등급
장점
- 대비 60% 적은 토큰 사용
- 5B 활성 파라미터 — 초저지연
- GitHub Copilot 및 VS Code에 깊이 통합됨
- Haiku보다 저렴한 $0.75/M 입력
단점
- 소형 모델 — 복잡한 다중 파일 작업에 취약
- 비전 지원 없음
- 코딩 작업에 한정 — 범용 아님
- 128K 컨텍스트는 플래그십 모델보다 작음
성능
출력 속도~150 tok/s
속도 제한10,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
HumanEval
92.0%
SWE-bench Lite
55.0%
MAI-Image-2.5
Flagship엔터프라이즈 이미지 생성 및 편집
사용 시기: 브랜드 안전 및 정책 준수 이미지 생성 및 편집을 위해 엔터프라이즈 및 Microsoft 365 워크플로우에서 사용합니다.
업그레이드 하이라이트
- ◆텍스트-이미지 + 이미지 편집을 하나의 모델로 통합
- ◆Arena ELO: Nano Banana Pro 초과
- ◆생성된 이미지에서 우수한 텍스트 렌더링
- ◆엔터프라이즈 규정 준수: 프라이빗 Azure 배포
- ◆더 저렴하고 빠른 생성을 위한 Flash 변형 제공
입력 가격
$5.00
per 1M tokens
출력 가격
$47.00
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 8K
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드
장점
- 텍스트-이미지 및 이미지 편집을 하나의 모델로 통합한 세계적 수준
- Nano Banana Pro Arena 점수 초과
- 엔터프라이즈급: 프라이빗 Azure 배포 가능
- 이미지 내 깔끔한 텍스트 렌더링
단점
- 토큰당 $47로 비싼 출력
- Midjourney만큼 예술적이지 않음
- Azure 중심 가용성
- 함수 호출 없음
성능
출력 속도~20 tok/s
속도 제한1,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
GenEval
88.0%
MAI-Image-2.5-Flash
Mid-tier빠르고 비용 효율적인 이미지 생성
사용 시기: 절대적인 품질보다 속도와 비용이 중요한 대량 이미지 생성에 사용합니다.
업그레이드 하이라이트
- ◆$1.75/$15 — MAI-Image-2.5보다 65% 저렴
- ◆고처리량 생성에 최적화
- ◆개발용 무료 티어 제공
- ◆MAI-Image-2.5와 동일한 모델 제품군
입력 가격
$1.75
per 1M tokens
출력 가격
$15.00
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 8K
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드무료 등급
장점
- 표준 MAI-Image-2.5보다 훨씬 저렴
- 대량 워크플로우를 위한 빠른 생성
- 대부분의 프롬프트에서 MAI-Image-2.5와 동일한 품질
- 무료 티어 제공
단점
- 복잡한 다중 객체 프롬프트에서 낮은 품질
- 함수 호출 없음
- Azure 중심
- 미세 질감에서 세부 묘사 부족
성능
출력 속도~40 tok/s
속도 제한5,000 RPM
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
GenEval
82.0%
MAI-Transcribe-1.5
Flagship엔터프라이즈 음성-텍스트 변환, 실시간 전사
사용 시기: 엔터프라이즈 회의 전사, 콜센터 분석, 의료 받아쓰기, 다국어 자막 생성에 사용합니다.
업그레이드 하이라이트
- ◆SOTA 정확도: 영어 및 다국어 ASR에서 Whisper Large v3를 능가
- ◆경쟁 전사 모델보다 5배 빠름
- ◆내장 도메인 어휘 지원을 포함한 43개 언어
- ◆화자 분리: 누가 무엇을 말했는지 식별
- ◆시간당 $0.36 — 엔터프라이즈 STT를 위한 경쟁력 있는 가격
입력 가격
$0.360
per 1M tokens
출력 가격
$0.0000
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 0
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드
장점
- 최고 수준의 전사 정확도 — ASR 벤치마크에서 SOTA
- 경쟁 모델보다 5배 빠름
- 도메인 특화 용어를 포함한 43개 언어 지원
- 화자 분리 및 실시간 스트리밍 지원
단점
- 전문화된 모델 — 전사 전용
- 토큰이 아닌 오디오 시간당 과금
- Azure 중심의 가용성
- 텍스트 생성 기능 없음
성능
출력 속도—
속도 제한—
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%
MAI-Voice-2
Flagship고품질 TTS, 음성 복제, 대화형 AI
사용 시기: 고객 서비스 음성 봇, 접근성 도구, e-러닝 콘텐츠 및 실시간 대화형 AI에 사용합니다.
업그레이드 하이라이트
- ◆자연스러운 운율과 톤 제어가 가능한 15개 언어
- ◆음성 복제: 짧은 오디오 샘플에서 적응
- ◆300ms 미만 지연 시간 — 실시간 대화에 적합
- ◆강력한 오용 방지 기능 내장
- ◆초저비용 배포를 위한 Flash 변형 제공
입력 가격
$2.00
per 1M tokens
출력 가격
$10.00
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 0
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드
장점
- 15개 언어에 걸친 자연스러운 음성
- 짧은 오디오 샘플로 음성 복제
- 실시간 대화를 위한 300ms 미만 지연 시간
- 엔터프라이즈 규정 준수 및 Azure 통합
단점
- 전문화된 모델 — 음성 합성 전용
- 음성 복제는 엔터프라이즈 게이팅 필요
- ElevenLabs보다 덜 유연한 복제
- Azure 중심 가용성
성능
출력 속도—
속도 제한—
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
MOS (Naturalness)
4.5/5.0
MAI-Voice-2-Flash
Mid-tier초저비용 음성 합성
사용 시기: 비용 효율성이 음질보다 중요한 대량 TTS 애플리케이션에 적합합니다.
업그레이드 하이라이트
- ◆$0.50/$2.50 — MAI-Voice-2보다 75% 저렴
- ◆개발 및 테스트용 무료 티어
- ◆MAI-Voice-2와 동일한 15개 언어 지원
- ◆고처리량, 저지연 배포에 최적화
입력 가격
$0.500
per 1M tokens
출력 가격
$2.50
per 1M tokens
캐시된 입력
—
per 1M tokens
배치 입력
—
per 1M tokens
컨텍스트 창: 0
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드무료 등급
장점
- 75% 저렴한 초효율 TTS
- 무료 티어 제공
- MAI-Voice-2와 동일한 언어 지원
- 실시간 애플리케이션에 적합한 낮은 지연 시간
단점
- MAI-Voice-2보다 약간 낮은 자연스러움
- Flash 변형에서는 음성 복제 불가
- 전문 모델 — 음성 전용
- 신규 모델 — 독립 리뷰 제한적
성능
출력 속도—
속도 제한—
멀티모달
이미지 입력이미지 출력오디오 입력오디오 출력
벤치마크
MOS (Naturalness)
4.2/5.0
나란히 비교
| 모델 | 등급 | 입력 | 출력 | 컨텍스트 |
|---|---|---|---|---|
| MAI-Thinking-1 | Reasoning | $5.00 | $20.00 | 262K |
| MAI-Code-1-Flash | Lite | $0.750 | $3.00 | 131K |
| MAI-Image-2.5 | Flagship | $5.00 | $47.00 | 8K |
| MAI-Image-2.5-Flash | Mid-tier | $1.75 | $15.00 | 8K |
| MAI-Transcribe-1.5 | Flagship | $0.360 | $0.0000 | 0 |
| MAI-Voice-2 | Flagship | $2.00 | $10.00 | 0 |
| MAI-Voice-2-Flash | Mid-tier | $0.500 | $2.50 | 0 |