
A Microsoft apresentou o MAI-Transcribe-2-Streaming, novo modelo de inteligência artificial desenvolvido para converter áudio em texto praticamente em tempo real. A tecnologia oferece suporte a 60 idiomas e foi projetada para aplicações que dependem de respostas rápidas.
Segundo os resultados divulgados, o modelo alcançou taxa de erro de 2,5% nos testes realizados. Outro destaque é a latência: o sistema consegue começar a retornar a transcrição em aproximadamente 0,13 segundo.
A combinação entre velocidade e precisão abre espaço para aplicações em reuniões, legendas em tempo real, assistentes de voz, atendimento ao cliente e ferramentas que precisam interpretar conversas enquanto elas acontecem.
O lançamento também mostra o avanço dos modelos especializados da Microsoft. Em vez de depender apenas de grandes modelos generalistas, a empresa desenvolve sistemas direcionados a tarefas específicas, como reconhecimento e transcrição de voz.



