Volver a la Zona de Desarrolladores

Microsoft Modelos

Explora todos los 7 modelos de Microsoft con precios detallados, ventajas y desventajas, y recomendaciones para desarrolladores.

7
Modelos
$0.360
Entrada Más Baja
262K
Contexto Máximo
4
Niveles de Calidad

Recomendaciones Rápidas

Mejor Relación Calidad-Precio: MAI-Transcribe-1.5 ($0.360/1M)
Mejor Calidad: MAI-Image-2.5
Mejor para Razonamiento: MAI-Thinking-1

MAI-Thinking-1

Reasoning

Razonamiento complejo, matemáticas, codificación agéntica

Precios Oficiales

Cuándo usar: Para razonamiento complejo de múltiples pasos, problemas matemáticos y codificación agéntica donde la precisión importa más que la velocidad bruta.

Mejoras clave

  • ~1T parámetros totales, 35B activos MoE — competitivo en peso medio
  • AIME 2025: 97,0%, AIME 2026: 94,5% — razonamiento matemático avanzado
  • SWE-bench Pro: competitivo con Claude Opus 4.6
  • Latencia de primer token más rápida que o3 para razonamiento en tiempo real
  • Datos limpios y trazables de nivel empresarial — sin destilación
Precio de Entrada
$5.00
per 1M tokens
Precio de Salida
$20.00
per 1M tokens
Entrada en Caché
$1.00
per 1M tokens
Entrada por Lote
per 1M tokens
Ventana de Contexto: 262K
Salida Máxima: 32,000 tokens
Fecha de Corte de Conocimiento: 2026-03
VisiónLlamada a FunciónAjuste FinoModo JSON

Ventajas

  • 35B activos / ~1T parámetros totales — potente para su clase
  • AIME 2025: 97,0%, AIME 2026: 94,5% — mejor razonamiento matemático
  • Sin destilación — entrenado desde cero con datos limpios
  • Preferido sobre Sonnet 4.6 en evaluaciones humanas ciegas

Desventajas

  • Aún sin soporte de visión
  • Modelo nuevo — benchmarks independientes limitados
  • Disponibilidad centrada en Azure
  • Costo más alto que modelos no razonadores

Rendimiento

Velocidad de salida~55 tok/s
Límite de tasa3,000 RPM

Multimodal

Entrada de imagenSalida de imagenEntrada de audioSalida de audio

Benchmarks

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

Codificación agéntica rápida, integración IDE

Precios Oficiales

Cuándo usar: Ideal para finalización rápida de código, sugerencias en línea y asistencia diaria de codificación en entornos IDE.

Mejoras clave

  • 5B parámetros activos — comparable a Haiku pero 60 % más barato
  • $0.75/M de entrada — modelo de codificación más barato del mercado
  • 60 % menos de tokens por tarea — diseño eficiente en inferencia
  • Integración nativa con GitHub Copilot y VS Code
  • HumanEval: 92 %+ — alta precisión de codificación en este tamaño
Precio de Entrada
$0.750
per 1M tokens
Precio de Salida
$3.00
per 1M tokens
Entrada en Caché
$0.150
per 1M tokens
Entrada por Lote
per 1M tokens
Ventana de Contexto: 131K
Salida Máxima: 16,384 tokens
Fecha de Corte de Conocimiento: 2026-03
VisiónLlamada a FunciónAjuste FinoModo JSONNivel Gratuito

Ventajas

  • 60 % menos de tokens por tarea frente a alternativas
  • 5B parámetros activos — latencia ultrabaja
  • Profundamente integrado en GitHub Copilot y VS Code
  • Más barato que Haiku a $0.75/M de entrada

Desventajas

  • Modelo más pequeño — más débil en tareas complejas de múltiples archivos
  • Sin soporte de visión
  • Limitado a tareas de codificación — no es de propósito general
  • Contexto de 128K más pequeño que los modelos insignia

Rendimiento

Velocidad de salida~150 tok/s
Límite de tasa10,000 RPM

Multimodal

Entrada de imagenSalida de imagenEntrada de audioSalida de audio

Benchmarks

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

Generación y edición de imágenes empresariales

Precios Oficiales

Cuándo usar: Para generación y edición de imágenes seguras para la marca y conformes con políticas en flujos de trabajo empresariales y de Microsoft 365.

Mejoras clave

  • Modelo unificado de texto a imagen + edición de imágenes en un solo modelo
  • ELO Arena: supera a Nano Banana Pro
  • Renderizado superior de texto en imágenes generadas
  • Cumplimiento empresarial: implementación privada en Azure
  • Variante Flash disponible para generación más barata y rápida
Precio de Entrada
$5.00
per 1M tokens
Precio de Salida
$47.00
per 1M tokens
Entrada en Caché
per 1M tokens
Entrada por Lote
per 1M tokens
Ventana de Contexto: 8K
Salida Máxima: 0 tokens
Fecha de Corte de Conocimiento: 2026-03
VisiónLlamada a FunciónAjuste FinoModo JSON

Ventajas

  • Modelo de clase mundial para generación de texto a imagen y edición de imágenes
  • Supera la puntuación de Nano Banana Pro Arena
  • Nivel empresarial: implementación privada en Azure disponible
  • Renderizado limpio de texto dentro de imágenes

Desventajas

  • Salida costosa a $47/M tokens
  • No tan artístico como Midjourney
  • Disponibilidad centrada en Azure
  • Sin llamada a funciones

Rendimiento

Velocidad de salida~20 tok/s
Límite de tasa1,000 RPM

Multimodal

Entrada de imagenSalida de imagenEntrada de audioSalida de audio

Benchmarks

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

Generación de imágenes rápida y rentable

Precios Oficiales

Cuándo usar: Para generación de imágenes de alto volumen donde la velocidad y el costo importan más que la calidad absoluta.

Mejoras clave

  • $1.75/$15 — 65 % más barato que MAI-Image-2.5
  • Optimizado para generación de alto rendimiento
  • Nivel gratuito disponible para desarrollo
  • Misma familia de modelos que MAI-Image-2.5
Precio de Entrada
$1.75
per 1M tokens
Precio de Salida
$15.00
per 1M tokens
Entrada en Caché
per 1M tokens
Entrada por Lote
per 1M tokens
Ventana de Contexto: 8K
Salida Máxima: 0 tokens
Fecha de Corte de Conocimiento: 2026-03
VisiónLlamada a FunciónAjuste FinoModo JSONNivel Gratuito

Ventajas

  • Mucho más barato que el MAI-Image-2.5 estándar
  • Generación rápida para flujos de trabajo de alto volumen
  • Misma calidad que MAI-Image-2.5 para la mayoría de las indicaciones
  • Nivel gratuito disponible

Desventajas

  • Menor calidad en indicaciones complejas con múltiples objetos
  • Sin llamada a funciones
  • Centrado en Azure
  • Menos detalle en texturas finas

Rendimiento

Velocidad de salida~40 tok/s
Límite de tasa5,000 RPM

Multimodal

Entrada de imagenSalida de imagenEntrada de audioSalida de audio

Benchmarks

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

Transcripción de voz empresarial, transcripción en tiempo real

Precios Oficiales

Cuándo usar: Para transcripción de reuniones empresariales, análisis de centros de llamadas, dictado médico y subtitulado multilingüe.

Mejoras clave

  • Precisión SOTA: supera a Whisper Large v3 en ASR inglés y multilingüe
  • 5 veces más rápido que los modelos de transcripción competidores
  • 43 idiomas con soporte integrado de vocabulario de dominio
  • Diarización de hablantes: identifica quién dijo qué
  • $0.36/hora — precio competitivo para STT empresarial
Precio de Entrada
$0.360
per 1M tokens
Precio de Salida
$0.0000
per 1M tokens
Entrada en Caché
per 1M tokens
Entrada por Lote
per 1M tokens
Ventana de Contexto: 0
Salida Máxima: 0 tokens
Fecha de Corte de Conocimiento: 2026-03
VisiónLlamada a FunciónAjuste FinoModo JSON

Ventajas

  • Mejor precisión de transcripción en su clase — SOTA en benchmarks ASR
  • 5 veces más rápido que los modelos competidores
  • 43 idiomas con terminología específica del dominio
  • Diarización de hablantes y transmisión en tiempo real

Desventajas

  • Modelo especializado — solo transcripción
  • Facturado por hora de audio, no por tokens
  • Disponibilidad centrada en Azure
  • Sin capacidades de generación de texto

Rendimiento

Velocidad de salida
Límite de tasa

Multimodal

Entrada de imagenSalida de imagenEntrada de audioSalida de audio

Benchmarks

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

TTS de alta calidad, clonación de voz, IA conversacional

Precios Oficiales

Cuándo usar: Para bots de voz de atención al cliente, herramientas de accesibilidad, contenido de e-learning e IA conversacional en tiempo real.

Mejoras clave

  • 15 idiomas con prosodia natural y control de tono
  • Clonación de voz: adaptación a partir de muestras de audio cortas
  • Latencia inferior a 300 ms — viable para diálogo en tiempo real
  • Sólidas medidas de protección integradas
  • Variante Flash disponible para implementación de costo ultrabajo
Precio de Entrada
$2.00
per 1M tokens
Precio de Salida
$10.00
per 1M tokens
Entrada en Caché
per 1M tokens
Entrada por Lote
per 1M tokens
Ventana de Contexto: 0
Salida Máxima: 0 tokens
Fecha de Corte de Conocimiento: 2026-03
VisiónLlamada a FunciónAjuste FinoModo JSON

Ventajas

  • Voz natural en 15 idiomas
  • Clonación de voz a partir de muestras de audio cortas
  • Latencia inferior a 300 ms para conversación en tiempo real
  • Cumplimiento empresarial e integración con Azure

Desventajas

  • Modelo especializado — solo síntesis de voz
  • La clonación de voz requiere autorización empresarial
  • Clonación menos flexible que ElevenLabs
  • Disponibilidad centrada en Azure

Rendimiento

Velocidad de salida
Límite de tasa

Multimodal

Entrada de imagenSalida de imagenEntrada de audioSalida de audio

Benchmarks

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

Síntesis de voz de costo ultra bajo

Precios Oficiales

Cuándo usar: Para aplicaciones TTS de alto volumen donde la eficiencia de costos importa más que la calidad absoluta de la voz.

Mejoras clave

  • $0.50/$2.50 — 75% más barato que MAI-Voice-2
  • Nivel gratuito para desarrollo y pruebas
  • Misma cobertura de 15 idiomas que MAI-Voice-2
  • Optimizado para implementación de alto rendimiento y baja latencia
Precio de Entrada
$0.500
per 1M tokens
Precio de Salida
$2.50
per 1M tokens
Entrada en Caché
per 1M tokens
Entrada por Lote
per 1M tokens
Ventana de Contexto: 0
Salida Máxima: 0 tokens
Fecha de Corte de Conocimiento: 2026-03
VisiónLlamada a FunciónAjuste FinoModo JSONNivel Gratuito

Ventajas

  • TTS ultraeficiente con un 75% menos de costo
  • Nivel gratuito disponible
  • Misma cobertura de idiomas que MAI-Voice-2
  • Baja latencia para aplicaciones en tiempo real

Desventajas

  • Naturalidad ligeramente inferior a MAI-Voice-2
  • Sin clonación de voz en la variante Flash
  • Modelo especializado — solo voz
  • Modelo más nuevo — reseñas independientes limitadas

Rendimiento

Velocidad de salida
Límite de tasa

Multimodal

Entrada de imagenSalida de imagenEntrada de audioSalida de audio

Benchmarks

MOS (Naturalness)
4.2/5.0

Comparación Lado a Lado

ModeloNivelEntradaSalidaContexto
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500