Modelos MAI da Microsoft trazem voz natural com latência de 100ms

Alex da Cruz
Alex da Cruz é desenvolvedor full-stack em São Paulo. Trabalha com React, TypeScript e automação, e usa inteligência artificial no dia a dia para resolver problemas reais de código e de operação — não como demonstração. Já tocou uma operação de e-commerce de ponta a ponta e hoje constrói e mantém o pipeline de automação por trás deste blog. Escreve aqui sobre o que testa de fato.
Segundo a Microsoft, o novo modelo MAI-Transcribe-2-Streaming entrega resultados parciais em pouco mais de 100 milissegundos em 60 idiomas. Essa velocidade permite que assistentes de voz processem a fala e respondam enquanto o usuário ainda está no meio da frase, eliminando as pausas artificiais em centrais de atendimento.
Quanto custam os novos modelos de voz da Microsoft?
Até o final do ano, a transcrição sai por $0,54 por hora de áudio no preço promocional. Na parte de síntese de voz, a variante MAI-Voice-2.1-Flash atinge uma latência de 150 milissegundos cobrando $15 por milhão de caracteres, abaixo dos $22 da versão padrão.
O que muda na automação de atendimento?
Os dois modelos de voz conseguem clonar um timbre a partir de poucos segundos de áudio de referência, acompanhados de travas de segurança contra uso indevido. Em testes citados pela empresa, cerca de metade de 4.000 participantes confundiram a voz sintética com uma pessoa real. Os modelos já estão disponíveis no Microsoft Foundry, MAI Playground e OpenRouter para integração em produção.
Fontes
Perguntas frequentes
- Qual é a latência do MAI-Transcribe-2-Streaming?
- O modelo entrega os primeiros resultados parciais em pouco mais de 100 milissegundos, permitindo respostas em tempo real.
- Qual o custo da transcrição da Microsoft?
- Até o final do ano, o custo promocional é de $0,54 por hora de áudio processado.
- Onde os modelos de voz estão disponíveis?
- Eles podem ser acessados via Microsoft Foundry, MAI Playground e OpenRouter.
Comentários
0 comentário
Seja o primeiro a comentar.
Continue Lendo

Manus 2.0: controle móvel, edição de vídeo e agentes
Manus 2.0 adiciona controle remoto via celular, edição de vídeo, hospedagem de jogos e reduz custos operacionais em 32 por cento.

Shopify libera checkout para agentes de IA no navegador
A Shopify agora permite que agentes de IA no navegador concluam compras no checkout usando ferramentas estruturadas do WebMCP.

Nvidia SoL-Pi: Como cortar custos de tokens em agentes de IA
O sistema SoL-Pi da Nvidia otimiza a camada de controle de agentes de código, cortando o consumo de tokens em até 49%.