개발자 영역으로 돌아가기

Microsoft 모델

Microsoft의 모든 7개 모델을 자세한 가격, 장단점 및 개발자 추천과 함께 살펴보세요.

7
모델
$0.360
최저 입력
262K
최대 컨텍스트
4
품질 등급

빠른 추천

최고 가성비: MAI-Transcribe-1.5 ($0.360/1M)
최고 품질: MAI-Image-2.5
추론에 최적: MAI-Thinking-1

MAI-Thinking-1

Reasoning

복잡한 추론, 수학, 에이전트 코딩

공식 가격

사용 시기: 정확성이 속도보다 중요한 복잡한 다단계 추론, 수학 문제 및 에이전트 코딩에 사용합니다.

업그레이드 하이라이트

  • ~1T 총 파라미터, 35B 활성 MoE — 중간급에서 경쟁력 있음
  • AIME 2025: 97.0%, AIME 2026: 94.5% — 고급 수학 추론
  • SWE-bench Pro: Claude Opus 4.6과 경쟁력 있음
  • 실시간 추론을 위한 o3보다 빠른 첫 토큰 지연 시간
  • 깨끗하고 추적 가능한 엔터프라이즈급 데이터 — 증류 없음
입력 가격
$5.00
per 1M tokens
출력 가격
$20.00
per 1M tokens
캐시된 입력
$1.00
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 262K
최대 출력: 32,000 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드

장점

  • 35B 활성 / ~1T 총 파라미터 — 동급 대비 강력함
  • AIME 2025: 97.0%, AIME 2026: 94.5% — 최고 수준의 수학 추론
  • 증류 없음 — 깨끗한 데이터로 처음부터 학습
  • 블라인드 인간 평가에서 Sonnet 4.6보다 선호됨

단점

  • 아직 비전 지원 없음
  • 신규 모델 — 제한된 독립 벤치마크
  • Azure 중심 가용성
  • 비추론 모델보다 높은 비용

성능

출력 속도~55 tok/s
속도 제한3,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

빠른 에이전트 코딩, IDE 통합

공식 가격

사용 시기: IDE 환경에서 빠른 코드 완성, 인라인 제안 및 일상적인 코딩 지원에 가장 적합합니다.

업그레이드 하이라이트

  • 5B 활성 파라미터 — Haiku와 유사하지만 60% 저렴
  • $0.75/M 입력 — 시장에서 가장 저렴한 코딩 모델
  • 작업당 60% 적은 토큰 — 추론 효율적 설계
  • 네이티브 GitHub Copilot 및 VS Code 통합
  • HumanEval: 92%+ — 이 크기에서 강력한 코딩 정확도
입력 가격
$0.750
per 1M tokens
출력 가격
$3.00
per 1M tokens
캐시된 입력
$0.150
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 131K
최대 출력: 16,384 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드무료 등급

장점

  • 대비 60% 적은 토큰 사용
  • 5B 활성 파라미터 — 초저지연
  • GitHub Copilot 및 VS Code에 깊이 통합됨
  • Haiku보다 저렴한 $0.75/M 입력

단점

  • 소형 모델 — 복잡한 다중 파일 작업에 취약
  • 비전 지원 없음
  • 코딩 작업에 한정 — 범용 아님
  • 128K 컨텍스트는 플래그십 모델보다 작음

성능

출력 속도~150 tok/s
속도 제한10,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

엔터프라이즈 이미지 생성 및 편집

공식 가격

사용 시기: 브랜드 안전 및 정책 준수 이미지 생성 및 편집을 위해 엔터프라이즈 및 Microsoft 365 워크플로우에서 사용합니다.

업그레이드 하이라이트

  • 텍스트-이미지 + 이미지 편집을 하나의 모델로 통합
  • Arena ELO: Nano Banana Pro 초과
  • 생성된 이미지에서 우수한 텍스트 렌더링
  • 엔터프라이즈 규정 준수: 프라이빗 Azure 배포
  • 더 저렴하고 빠른 생성을 위한 Flash 변형 제공
입력 가격
$5.00
per 1M tokens
출력 가격
$47.00
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 8K
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드

장점

  • 텍스트-이미지 및 이미지 편집을 하나의 모델로 통합한 세계적 수준
  • Nano Banana Pro Arena 점수 초과
  • 엔터프라이즈급: 프라이빗 Azure 배포 가능
  • 이미지 내 깔끔한 텍스트 렌더링

단점

  • 토큰당 $47로 비싼 출력
  • Midjourney만큼 예술적이지 않음
  • Azure 중심 가용성
  • 함수 호출 없음

성능

출력 속도~20 tok/s
속도 제한1,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

빠르고 비용 효율적인 이미지 생성

공식 가격

사용 시기: 절대적인 품질보다 속도와 비용이 중요한 대량 이미지 생성에 사용합니다.

업그레이드 하이라이트

  • $1.75/$15 — MAI-Image-2.5보다 65% 저렴
  • 고처리량 생성에 최적화
  • 개발용 무료 티어 제공
  • MAI-Image-2.5와 동일한 모델 제품군
입력 가격
$1.75
per 1M tokens
출력 가격
$15.00
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 8K
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드무료 등급

장점

  • 표준 MAI-Image-2.5보다 훨씬 저렴
  • 대량 워크플로우를 위한 빠른 생성
  • 대부분의 프롬프트에서 MAI-Image-2.5와 동일한 품질
  • 무료 티어 제공

단점

  • 복잡한 다중 객체 프롬프트에서 낮은 품질
  • 함수 호출 없음
  • Azure 중심
  • 미세 질감에서 세부 묘사 부족

성능

출력 속도~40 tok/s
속도 제한5,000 RPM

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

엔터프라이즈 음성-텍스트 변환, 실시간 전사

공식 가격

사용 시기: 엔터프라이즈 회의 전사, 콜센터 분석, 의료 받아쓰기, 다국어 자막 생성에 사용합니다.

업그레이드 하이라이트

  • SOTA 정확도: 영어 및 다국어 ASR에서 Whisper Large v3를 능가
  • 경쟁 전사 모델보다 5배 빠름
  • 내장 도메인 어휘 지원을 포함한 43개 언어
  • 화자 분리: 누가 무엇을 말했는지 식별
  • 시간당 $0.36 — 엔터프라이즈 STT를 위한 경쟁력 있는 가격
입력 가격
$0.360
per 1M tokens
출력 가격
$0.0000
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 0
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드

장점

  • 최고 수준의 전사 정확도 — ASR 벤치마크에서 SOTA
  • 경쟁 모델보다 5배 빠름
  • 도메인 특화 용어를 포함한 43개 언어 지원
  • 화자 분리 및 실시간 스트리밍 지원

단점

  • 전문화된 모델 — 전사 전용
  • 토큰이 아닌 오디오 시간당 과금
  • Azure 중심의 가용성
  • 텍스트 생성 기능 없음

성능

출력 속도
속도 제한

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

고품질 TTS, 음성 복제, 대화형 AI

공식 가격

사용 시기: 고객 서비스 음성 봇, 접근성 도구, e-러닝 콘텐츠 및 실시간 대화형 AI에 사용합니다.

업그레이드 하이라이트

  • 자연스러운 운율과 톤 제어가 가능한 15개 언어
  • 음성 복제: 짧은 오디오 샘플에서 적응
  • 300ms 미만 지연 시간 — 실시간 대화에 적합
  • 강력한 오용 방지 기능 내장
  • 초저비용 배포를 위한 Flash 변형 제공
입력 가격
$2.00
per 1M tokens
출력 가격
$10.00
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 0
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드

장점

  • 15개 언어에 걸친 자연스러운 음성
  • 짧은 오디오 샘플로 음성 복제
  • 실시간 대화를 위한 300ms 미만 지연 시간
  • 엔터프라이즈 규정 준수 및 Azure 통합

단점

  • 전문화된 모델 — 음성 합성 전용
  • 음성 복제는 엔터프라이즈 게이팅 필요
  • ElevenLabs보다 덜 유연한 복제
  • Azure 중심 가용성

성능

출력 속도
속도 제한

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

초저비용 음성 합성

공식 가격

사용 시기: 비용 효율성이 음질보다 중요한 대량 TTS 애플리케이션에 적합합니다.

업그레이드 하이라이트

  • $0.50/$2.50 — MAI-Voice-2보다 75% 저렴
  • 개발 및 테스트용 무료 티어
  • MAI-Voice-2와 동일한 15개 언어 지원
  • 고처리량, 저지연 배포에 최적화
입력 가격
$0.500
per 1M tokens
출력 가격
$2.50
per 1M tokens
캐시된 입력
per 1M tokens
배치 입력
per 1M tokens
컨텍스트 창: 0
최대 출력: 0 tokens
지식 기준일: 2026-03
비전함수 호출파인튜닝JSON 모드무료 등급

장점

  • 75% 저렴한 초효율 TTS
  • 무료 티어 제공
  • MAI-Voice-2와 동일한 언어 지원
  • 실시간 애플리케이션에 적합한 낮은 지연 시간

단점

  • MAI-Voice-2보다 약간 낮은 자연스러움
  • Flash 변형에서는 음성 복제 불가
  • 전문 모델 — 음성 전용
  • 신규 모델 — 독립 리뷰 제한적

성능

출력 속도
속도 제한

멀티모달

이미지 입력이미지 출력오디오 입력오디오 출력

벤치마크

MOS (Naturalness)
4.2/5.0

나란히 비교

모델등급입력출력컨텍스트
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500