Microsoft Modelos
Explore todos os 7 modelos de Microsoft com preços detalhados, prós e contras e recomendações para desenvolvedores.
Recomendações Rápidas
MAI-Thinking-1
ReasoningRaciocínio complexo, matemática, codificação agêntica
Quando usar: Para raciocínio complexo de múltiplas etapas, problemas matemáticos e codificação agêntica onde a precisão importa mais que a velocidade bruta.
Destaques da Atualização
- ◆~1T parâmetros totais, 35B ativos MoE — competitivo em peso médio
- ◆AIME 2025: 97,0%, AIME 2026: 94,5% — raciocínio matemático avançado
- ◆SWE-bench Pro: competitivo com Claude Opus 4.6
- ◆Latência de primeiro token mais rápida que o3 para raciocínio em tempo real
- ◆Dados limpos e rastreáveis de nível empresarial — sem destilação
Prós
- 35B ativos / ~1T parâmetros totais — forte para sua classe de peso
- AIME 2025: 97,0%, AIME 2026: 94,5% — raciocínio matemático de ponta
- Sem destilação — treinado do zero com dados limpos
- Preferido ao Sonnet 4.6 em avaliações humanas cegas
Contras
- Ainda sem suporte para visão
- Modelo novo — benchmarks independentes limitados
- Disponibilidade centrada no Azure
- Custo mais alto que modelos sem raciocínio
Desempenho
Multimodal
Benchmarks
MAI-Code-1-Flash
LiteCodificação agente rápida, integração com IDE
Quando usar: Melhor para conclusão rápida de código, sugestões inline e assistência diária de codificação em ambientes IDE.
Destaques da Atualização
- ◆5B parâmetros ativos — comparável ao Haiku, mas 60% mais barato
- ◆$0,75/M de entrada — modelo de codificação mais barato do mercado
- ◆60% menos tokens por tarefa — design eficiente em inferência
- ◆Integração nativa com GitHub Copilot e VS Code
- ◆HumanEval: 92%+ — forte precisão de codificação neste tamanho
Prós
- 60% menos tokens por tarefa em comparação com alternativas
- 5B parâmetros ativos — latência ultrabaixa
- Profundamente integrado ao GitHub Copilot e VS Code
- Mais barato que Haiku a $0,75/M de entrada
Contras
- Modelo menor — mais fraco em tarefas complexas de múltiplos arquivos
- Sem suporte para visão
- Limitado a tarefas de codificação — não é de uso geral
- Contexto de 128K é menor que modelos principais
Desempenho
Multimodal
Benchmarks
MAI-Image-2.5
FlagshipGeração e edição de imagens empresariais
Quando usar: Para geração e edição de imagens seguras para a marca e em conformidade com políticas em fluxos de trabalho empresariais e do Microsoft 365.
Destaques da Atualização
- ◆Modelo unificado de texto-para-imagem + edição de imagens em um único modelo
- ◆ELO da Arena: supera o Nano Banana Pro
- ◆Renderização superior de texto em imagens geradas
- ◆Conformidade empresarial: implantação privada no Azure
- ◆Variante Flash disponível para geração mais barata e rápida
Prós
- Modelo de classe mundial para texto-para-imagem e edição de imagens em um único modelo
- Supera a pontuação do Nano Banana Pro Arena
- Nível empresarial: implantação privada no Azure disponível
- Renderização limpa de texto dentro das imagens
Contras
- Saída cara a $47/M tokens
- Não é tão artístico quanto o Midjourney
- Disponibilidade centrada no Azure
- Sem chamada de função
Desempenho
Multimodal
Benchmarks
MAI-Image-2.5-Flash
Mid-tierGeração de imagens rápida e econômica
Quando usar: Para geração de imagens em alto volume, onde velocidade e custo são mais importantes que a qualidade absoluta.
Destaques da Atualização
- ◆$1.75/$15 — 65% mais barato que o MAI-Image-2.5
- ◆Otimizado para geração de alto rendimento
- ◆Camada gratuita disponível para desenvolvimento
- ◆Mesma família de modelos do MAI-Image-2.5
Prós
- Muito mais barato que o MAI-Image-2.5 padrão
- Geração rápida para fluxos de trabalho de alto volume
- Mesma qualidade do MAI-Image-2.5 para a maioria dos prompts
- Camada gratuita disponível
Contras
- Qualidade inferior em prompts complexos com múltiplos objetos
- Sem chamada de função
- Foco no Azure
- Menos detalhes em texturas finas
Desempenho
Multimodal
Benchmarks
MAI-Transcribe-1.5
FlagshipTranscrição de fala empresarial, transcrição em tempo real
Quando usar: Para transcrição de reuniões empresariais, análise de call centers, ditado médico e legendagem multilíngue.
Destaques da Atualização
- ◆Precisão SOTA: supera Whisper Large v3 em ASR inglês e multilíngue
- ◆5x mais rápido que modelos concorrentes de transcrição
- ◆43 idiomas com suporte a vocabulário de domínio integrado
- ◆Diarização de falantes: identifica quem disse o quê
- ◆$0.36/hora — preço competitivo para STT empresarial
Prós
- Melhor precisão de transcrição da classe — SOTA em benchmarks ASR
- 5x mais rápido que modelos concorrentes
- 43 idiomas com terminologia específica de domínio
- Diarização de falantes e streaming em tempo real
Contras
- Modelo especializado — apenas transcrição
- Preço por hora de áudio, não por tokens
- Disponibilidade centrada no Azure
- Sem capacidades de geração de texto
Desempenho
Multimodal
Benchmarks
MAI-Voice-2
FlagshipTTS de alta qualidade, clonagem de voz, IA conversacional
Quando usar: Para bots de voz de atendimento ao cliente, ferramentas de acessibilidade, conteúdo de e-learning e IA conversacional em tempo real.
Destaques da Atualização
- ◆15 idiomas com prosódia natural e controle de tom
- ◆Clonagem de voz: adapte-se a partir de amostras curtas de áudio
- ◆Latência inferior a 300ms — viável para diálogo em tempo real
- ◆Fortes salvaguardas contra uso indevido integradas
- ◆Variante Flash disponível para implantação de custo ultrabaixo
Prós
- Fala com som natural em 15 idiomas
- Clonagem de voz a partir de amostras curtas de áudio
- Latência inferior a 300ms para conversação em tempo real
- Conformidade empresarial e integração com Azure
Contras
- Modelo especializado — apenas síntese de fala
- Clonagem de voz requer acesso empresarial
- Clonagem menos flexível que a ElevenLabs
- Disponibilidade centrada no Azure
Desempenho
Multimodal
Benchmarks
MAI-Voice-2-Flash
Mid-tierSíntese de fala de custo ultrabaixo
Quando usar: Para aplicações de TTS de alto volume onde a eficiência de custo é mais importante que a qualidade absoluta da voz.
Destaques da Atualização
- ◆$0.50/$2.50 — 75% mais barato que MAI-Voice-2
- ◆Camada gratuita para desenvolvimento e testes
- ◆Mesma cobertura de 15 idiomas que MAI-Voice-2
- ◆Otimizado para implantação de alto rendimento e baixa latência
Prós
- TTS ultraeficiente com 75% de redução de custo
- Camada gratuita disponível
- Mesma cobertura de idiomas que MAI-Voice-2
- Baixa latência para aplicações em tempo real
Contras
- Naturalidade ligeiramente inferior à do MAI-Voice-2
- Sem clonagem de voz na variante Flash
- Modelo especializado — apenas fala
- Modelo mais novo — avaliações independentes limitadas
Desempenho
Multimodal
Benchmarks
Comparação Lado a Lado
| Modelo | Nível | Entrada | Saída | Contexto |
|---|---|---|---|---|
| MAI-Thinking-1 | Reasoning | $5.00 | $20.00 | 262K |
| MAI-Code-1-Flash | Lite | $0.750 | $3.00 | 131K |
| MAI-Image-2.5 | Flagship | $5.00 | $47.00 | 8K |
| MAI-Image-2.5-Flash | Mid-tier | $1.75 | $15.00 | 8K |
| MAI-Transcribe-1.5 | Flagship | $0.360 | $0.0000 | 0 |
| MAI-Voice-2 | Flagship | $2.00 | $10.00 | 0 |
| MAI-Voice-2-Flash | Mid-tier | $0.500 | $2.50 | 0 |