Voltar à Zona do Desenvolvedor

Microsoft Modelos

Explore todos os 7 modelos de Microsoft com preços detalhados, prós e contras e recomendações para desenvolvedores.

7
Modelos
$0.360
Menor Entrada
262K
Contexto Máximo
4
Níveis de Qualidade

Recomendações Rápidas

Melhor Custo-Benefício: MAI-Transcribe-1.5 ($0.360/1M)
Melhor Qualidade: MAI-Image-2.5
Melhor para Raciocínio: MAI-Thinking-1

MAI-Thinking-1

Reasoning

Raciocínio complexo, matemática, codificação agêntica

Preços Oficiais

Quando usar: Para raciocínio complexo de múltiplas etapas, problemas matemáticos e codificação agêntica onde a precisão importa mais que a velocidade bruta.

Destaques da Atualização

  • ~1T parâmetros totais, 35B ativos MoE — competitivo em peso médio
  • AIME 2025: 97,0%, AIME 2026: 94,5% — raciocínio matemático avançado
  • SWE-bench Pro: competitivo com Claude Opus 4.6
  • Latência de primeiro token mais rápida que o3 para raciocínio em tempo real
  • Dados limpos e rastreáveis de nível empresarial — sem destilação
Preço de Entrada
$5.00
per 1M tokens
Preço de Saída
$20.00
per 1M tokens
Entrada em Cache
$1.00
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 262K
Saída Máxima: 32,000 tokens
Corte de Conhecimento: 2026-03
VisãoChamada de FunçãoAjuste FinoModo JSON

Prós

  • 35B ativos / ~1T parâmetros totais — forte para sua classe de peso
  • AIME 2025: 97,0%, AIME 2026: 94,5% — raciocínio matemático de ponta
  • Sem destilação — treinado do zero com dados limpos
  • Preferido ao Sonnet 4.6 em avaliações humanas cegas

Contras

  • Ainda sem suporte para visão
  • Modelo novo — benchmarks independentes limitados
  • Disponibilidade centrada no Azure
  • Custo mais alto que modelos sem raciocínio

Desempenho

Velocidade de saída~55 tok/s
Limite de taxa3,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

AIME 2025
97.0%
AIME 2026
94.5%
GPQA Diamond
82.0%

MAI-Code-1-Flash

Lite

Codificação agente rápida, integração com IDE

Preços Oficiais

Quando usar: Melhor para conclusão rápida de código, sugestões inline e assistência diária de codificação em ambientes IDE.

Destaques da Atualização

  • 5B parâmetros ativos — comparável ao Haiku, mas 60% mais barato
  • $0,75/M de entrada — modelo de codificação mais barato do mercado
  • 60% menos tokens por tarefa — design eficiente em inferência
  • Integração nativa com GitHub Copilot e VS Code
  • HumanEval: 92%+ — forte precisão de codificação neste tamanho
Preço de Entrada
$0.750
per 1M tokens
Preço de Saída
$3.00
per 1M tokens
Entrada em Cache
$0.150
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 131K
Saída Máxima: 16,384 tokens
Corte de Conhecimento: 2026-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • 60% menos tokens por tarefa em comparação com alternativas
  • 5B parâmetros ativos — latência ultrabaixa
  • Profundamente integrado ao GitHub Copilot e VS Code
  • Mais barato que Haiku a $0,75/M de entrada

Contras

  • Modelo menor — mais fraco em tarefas complexas de múltiplos arquivos
  • Sem suporte para visão
  • Limitado a tarefas de codificação — não é de uso geral
  • Contexto de 128K é menor que modelos principais

Desempenho

Velocidade de saída~150 tok/s
Limite de taxa10,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

HumanEval
92.0%
SWE-bench Lite
55.0%

MAI-Image-2.5

Flagship

Geração e edição de imagens empresariais

Preços Oficiais

Quando usar: Para geração e edição de imagens seguras para a marca e em conformidade com políticas em fluxos de trabalho empresariais e do Microsoft 365.

Destaques da Atualização

  • Modelo unificado de texto-para-imagem + edição de imagens em um único modelo
  • ELO da Arena: supera o Nano Banana Pro
  • Renderização superior de texto em imagens geradas
  • Conformidade empresarial: implantação privada no Azure
  • Variante Flash disponível para geração mais barata e rápida
Preço de Entrada
$5.00
per 1M tokens
Preço de Saída
$47.00
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 8K
Saída Máxima: 0 tokens
Corte de Conhecimento: 2026-03
VisãoChamada de FunçãoAjuste FinoModo JSON

Prós

  • Modelo de classe mundial para texto-para-imagem e edição de imagens em um único modelo
  • Supera a pontuação do Nano Banana Pro Arena
  • Nível empresarial: implantação privada no Azure disponível
  • Renderização limpa de texto dentro das imagens

Contras

  • Saída cara a $47/M tokens
  • Não é tão artístico quanto o Midjourney
  • Disponibilidade centrada no Azure
  • Sem chamada de função

Desempenho

Velocidade de saída~20 tok/s
Limite de taxa1,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

GenEval
88.0%

MAI-Image-2.5-Flash

Mid-tier

Geração de imagens rápida e econômica

Preços Oficiais

Quando usar: Para geração de imagens em alto volume, onde velocidade e custo são mais importantes que a qualidade absoluta.

Destaques da Atualização

  • $1.75/$15 — 65% mais barato que o MAI-Image-2.5
  • Otimizado para geração de alto rendimento
  • Camada gratuita disponível para desenvolvimento
  • Mesma família de modelos do MAI-Image-2.5
Preço de Entrada
$1.75
per 1M tokens
Preço de Saída
$15.00
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 8K
Saída Máxima: 0 tokens
Corte de Conhecimento: 2026-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • Muito mais barato que o MAI-Image-2.5 padrão
  • Geração rápida para fluxos de trabalho de alto volume
  • Mesma qualidade do MAI-Image-2.5 para a maioria dos prompts
  • Camada gratuita disponível

Contras

  • Qualidade inferior em prompts complexos com múltiplos objetos
  • Sem chamada de função
  • Foco no Azure
  • Menos detalhes em texturas finas

Desempenho

Velocidade de saída~40 tok/s
Limite de taxa5,000 RPM

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

GenEval
82.0%

MAI-Transcribe-1.5

Flagship

Transcrição de fala empresarial, transcrição em tempo real

Preços Oficiais

Quando usar: Para transcrição de reuniões empresariais, análise de call centers, ditado médico e legendagem multilíngue.

Destaques da Atualização

  • Precisão SOTA: supera Whisper Large v3 em ASR inglês e multilíngue
  • 5x mais rápido que modelos concorrentes de transcrição
  • 43 idiomas com suporte a vocabulário de domínio integrado
  • Diarização de falantes: identifica quem disse o quê
  • $0.36/hora — preço competitivo para STT empresarial
Preço de Entrada
$0.360
per 1M tokens
Preço de Saída
$0.0000
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 0
Saída Máxima: 0 tokens
Corte de Conhecimento: 2026-03
VisãoChamada de FunçãoAjuste FinoModo JSON

Prós

  • Melhor precisão de transcrição da classe — SOTA em benchmarks ASR
  • 5x mais rápido que modelos concorrentes
  • 43 idiomas com terminologia específica de domínio
  • Diarização de falantes e streaming em tempo real

Contras

  • Modelo especializado — apenas transcrição
  • Preço por hora de áudio, não por tokens
  • Disponibilidade centrada no Azure
  • Sem capacidades de geração de texto

Desempenho

Velocidade de saída
Limite de taxa

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

WER (LibriSpeech)
1.8%
WER (Common Voice)
5.2%

MAI-Voice-2

Flagship

TTS de alta qualidade, clonagem de voz, IA conversacional

Preços Oficiais

Quando usar: Para bots de voz de atendimento ao cliente, ferramentas de acessibilidade, conteúdo de e-learning e IA conversacional em tempo real.

Destaques da Atualização

  • 15 idiomas com prosódia natural e controle de tom
  • Clonagem de voz: adapte-se a partir de amostras curtas de áudio
  • Latência inferior a 300ms — viável para diálogo em tempo real
  • Fortes salvaguardas contra uso indevido integradas
  • Variante Flash disponível para implantação de custo ultrabaixo
Preço de Entrada
$2.00
per 1M tokens
Preço de Saída
$10.00
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 0
Saída Máxima: 0 tokens
Corte de Conhecimento: 2026-03
VisãoChamada de FunçãoAjuste FinoModo JSON

Prós

  • Fala com som natural em 15 idiomas
  • Clonagem de voz a partir de amostras curtas de áudio
  • Latência inferior a 300ms para conversação em tempo real
  • Conformidade empresarial e integração com Azure

Contras

  • Modelo especializado — apenas síntese de fala
  • Clonagem de voz requer acesso empresarial
  • Clonagem menos flexível que a ElevenLabs
  • Disponibilidade centrada no Azure

Desempenho

Velocidade de saída
Limite de taxa

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MOS (Naturalness)
4.5/5.0

MAI-Voice-2-Flash

Mid-tier

Síntese de fala de custo ultrabaixo

Preços Oficiais

Quando usar: Para aplicações de TTS de alto volume onde a eficiência de custo é mais importante que a qualidade absoluta da voz.

Destaques da Atualização

  • $0.50/$2.50 — 75% mais barato que MAI-Voice-2
  • Camada gratuita para desenvolvimento e testes
  • Mesma cobertura de 15 idiomas que MAI-Voice-2
  • Otimizado para implantação de alto rendimento e baixa latência
Preço de Entrada
$0.500
per 1M tokens
Preço de Saída
$2.50
per 1M tokens
Entrada em Cache
per 1M tokens
Entrada em Lote
per 1M tokens
Janela de Contexto: 0
Saída Máxima: 0 tokens
Corte de Conhecimento: 2026-03
VisãoChamada de FunçãoAjuste FinoModo JSONNível Gratuito

Prós

  • TTS ultraeficiente com 75% de redução de custo
  • Camada gratuita disponível
  • Mesma cobertura de idiomas que MAI-Voice-2
  • Baixa latência para aplicações em tempo real

Contras

  • Naturalidade ligeiramente inferior à do MAI-Voice-2
  • Sem clonagem de voz na variante Flash
  • Modelo especializado — apenas fala
  • Modelo mais novo — avaliações independentes limitadas

Desempenho

Velocidade de saída
Limite de taxa

Multimodal

Entrada de imagemSaída de imagemEntrada de áudioSaída de áudio

Benchmarks

MOS (Naturalness)
4.2/5.0

Comparação Lado a Lado

ModeloNívelEntradaSaídaContexto
MAI-Thinking-1Reasoning$5.00$20.00262K
MAI-Code-1-FlashLite$0.750$3.00131K
MAI-Image-2.5Flagship$5.00$47.008K
MAI-Image-2.5-FlashMid-tier$1.75$15.008K
MAI-Transcribe-1.5Flagship$0.360$0.00000
MAI-Voice-2Flagship$2.00$10.000
MAI-Voice-2-FlashMid-tier$0.500$2.500