El primer modelo de transcripción en streaming de Microsoft debuta en el número 1 de Artificial Analysis
Microsoft lanzó MAI-Transcribe-2-Streaming, con transcripción en tiempo real en 60 idiomas a 0,54 dólares por hora, junto a dos modelos de voz nuevos. El objetivo declarado es cerrar el ciclo completo de un agente de voz.

La noticia en 30 segundos
Microsoft presentó el 1 de octubre de 2026 MAI-Transcribe-2-Streaming, su primer modelo de transcripción en tiempo real, que debutó en el primer lugar de precisión de Artificial Analysis tanto en transcripciones finales como parciales. Entrega texto en 60 idiomas con detección automática y continua del idioma, y produce sus primeras hipótesis algo más de 100 milisegundos después de recibir el audio, a un precio introductorio de 0,54 dólares por hora hasta fin de año. Junto con él, Microsoft lanzó los modelos de voz MAI-Voice-2.1 y MAI-Voice-2.1-Flash, de 22 y 15 dólares por millón de caracteres.
Microsoft anunció el 1 de octubre de 2026 el lanzamiento de MAI-Transcribe-2-Streaming, su primer modelo de transcripción en tiempo real, que según la compañía debutó en el primer lugar de precisión del ranking de Artificial Analysis tanto en transcripciones finales como en parciales. En la evaluación de precisión contra latencia, Microsoft afirma ubicarse en la frontera de Pareto, es decir que la mayor precisión no se paga con más demora.
El anuncio no vino solo. En el mismo movimiento la compañía presentó dos modelos de voz: MAI-Voice-2.1 y una variante de alto volumen, MAI-Voice-2.1-Flash. La tesis que Microsoft pone por escrito es que un agente de voz es un ciclo que tiene que oír, entender, decidir y hablar dentro de la ventana en que una persona todavía percibe la interacción como una conversación.
¿Qué hace distinto a un modelo de transcripción en streaming?
La diferencia es cuándo entrega el texto. En lugar de esperar a que alguien termine de hablar para devolver la transcripción, MAI-Transcribe-2-Streaming produce sus primeras hipótesis, llamadas parciales, algo más de 100 milisegundos después de recibir el audio, las corrige a medida que llega más contexto y fija una transcripción estable de inmediato.
Eso habilita algo concreto: un agente puede empezar a razonar o a llamar herramientas a mitad de una frase, sin esperar el punto final. Para dictado o subtitulado en vivo, Microsoft reporta en evaluaciones internas que las palabras aparecen 2 veces más rápido que con su competidor más cercano. Conviene leer ese dato como lo que es: una medición del propio proveedor, no de un tercero.
El modelo cubre 60 idiomas con detección automática y continua del idioma, lo que significa que no hay que declararle de antemano en qué lengua va a hablar la persona.
¿Cuánto cuesta operar un agente de voz con estos modelos?
Los precios publicados son los siguientes:
- MAI-Transcribe-2-Streaming: 0,54 dólares por hora de audio, precio introductorio hasta fin de año.
- MAI-Voice-2.1: 22 dólares por millón de caracteres, orientado a usos de alta fidelidad.
- MAI-Voice-2.1-Flash: 15 dólares por millón de caracteres, con una inferencia 55% más rápida y, según Microsoft, cerca de 60% más económica que modelos comparables.
Flash es la pieza pensada para volumen y sensibilidad a la latencia: genera 45 segundos de audio con una latencia de extremo a extremo de 150 milisegundos. Microsoft la propone como la pareja natural del modelo de transcripción para armar agentes de voz que no se sientan lentos.
Ambos modelos de voz permiten clonar una voz a partir de unos pocos segundos de audio de referencia, con barreras de consentimiento incorporadas para prevenir el uso indebido.
¿Por qué importa el soporte multilingüe para Chile y Latinoamérica?
MAI-Voice-2.1 soporta 23 idiomas y 26 variantes regionales, y el punto técnico que Microsoft destaca es que una misma voz puede usar todos esos idiomas con acento nativo en cada uno. El ejemplo que da la compañía es directo: se le puede pedir que hable en inglés, después en mandarín, después en alemán, y el hablante sigue siendo reconociblemente el mismo, adoptando el habla local en vez de arrastrar un solo acento.
Para una operación que atiende varios mercados desde Chile hacia el resto de Latinoamérica, eso cambia un costo específico: hasta ahora sostener una marca sonora consistente en varios países implicaba grabar o licenciar voces distintas por mercado. Si la promesa se sostiene en producción, la identidad de voz deja de fragmentarse por frontera.
Vale precisar un límite: Microsoft publica la cifra de 23 idiomas y 26 variantes regionales, pero no detalla en el anuncio el listado por país. Antes de comprometer un despliegue en la región corresponde verificar qué variantes del español quedan efectivamente cubiertas.
¿Dónde se pueden usar hoy?
Los dos modelos de voz están disponibles a través de OpenRouter, y los tres modelos a través de Microsoft Foundry, el MAI Playground y Vercel. Microsoft indica que LiveKit llegará pronto, y los modelos también están en Azure Voice Live. Para mostrar las piezas funcionando juntas, la compañía publicó Chatter, una demostración de agente en vivo dentro del MAI Playground.
Los usos que Microsoft nombra como construibles hoy son tres: agentes de servicio al cliente que transcriben el pedido mientras se dice y empiezan a actuar antes de que la persona termine, asistentes multilingües que detectan el idioma hablado y responden en cualquiera de los 23 idiomas soportados con la misma voz, y contenidos interactivos de aprendizaje con hablantes distintos.
Análisis de Revenue Hub
Lo relevante para un líder comercial no es el ranking de precisión, es que el costo de un agente de voz acaba de volverse calculable con una servilleta. A 0,54 dólares la hora de transcripción, una operación que atiende mil llamadas mensuales de seis minutos gasta cerca de 54 dólares en transcribirlas. Ese orden de magnitud saca a la voz de la categoría de proyecto de innovación con presupuesto propio y la mete en la de línea operativa. Cuando el insumo baja así, la pregunta de inversión deja de ser si el modelo alcanza y pasa a ser si el proceso aguanta.
Ahí está el cuello real, y conviene decirlo sin suavizarlo: la latencia que estos modelos ahorran se pierde completa si el agente tiene que consultar un CRM con datos sucios o esperar a una integración lenta para saber quién está llamando. Microsoft optimizó los dos extremos del ciclo, oír y hablar, y dejó intacto el del medio, decidir. Ese tramo es de arquitectura de datos propia, no de proveedor de modelos. Una empresa en Chile o Latinoamérica que hoy no puede responder en menos de un segundo quién es el cliente que llama y qué tiene abierto no va a notar la mejora, por más rápido que transcriba.
La decisión concreta que sugerimos es ordenar la secuencia: antes de pilotear un agente de voz, medir el tiempo de respuesta de las consultas que el agente va a necesitar en la conversación, y recién después elegir modelo. El riesgo contrario, bastante común, es comprar la capa de voz primero y descubrir en producción que el límite estaba en la base de datos. Seguimos esta clase de movimientos de proveedores en la sección de IA aplicada a ventas, y publicamos criterios de arquitectura de datos comercial en el blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a Microsoft AI.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Qué es MAI-Transcribe-2-Streaming?
Es el primer modelo de transcripción en tiempo real de Microsoft, anunciado el 1 de octubre de 2026. Entrega transcripciones en 60 idiomas con detección automática y continua del idioma, y produce sus primeras hipótesis algo más de 100 milisegundos después de recibir el audio. Debutó en el primer lugar de precisión de Artificial Analysis en transcripciones finales y parciales.
¿Cuánto cuesta MAI-Transcribe-2-Streaming?
Microsoft publicó un precio introductorio de 0,54 dólares por hora de audio, vigente hasta fin de año. A modo de referencia, mil llamadas mensuales de seis minutos equivalen a cien horas de audio, es decir cerca de 54 dólares de transcripción al mes.
¿Cuál es la diferencia entre MAI-Voice-2.1 y MAI-Voice-2.1-Flash?
MAI-Voice-2.1 cuesta 22 dólares por millón de caracteres y apunta a usos de alta fidelidad. Flash cuesta 15 dólares por millón de caracteres, genera 45 segundos de audio con 150 milisegundos de latencia de extremo a extremo y tiene una inferencia 55% más rápida, orientada a volumen y a cargas sensibles a la latencia. Soportan los mismos idiomas.
¿Cuántos idiomas soportan los modelos de voz de Microsoft?
MAI-Voice-2.1 y su variante Flash soportan 23 idiomas y 26 variantes regionales, y una misma voz puede usar todos esos idiomas con acento nativo en cada uno. El modelo de transcripción, en cambio, cubre 60 idiomas. Microsoft no detalla en el anuncio el listado de variantes por país.
¿Se puede clonar una voz de marca con estos modelos?
Sí. Ambos modelos de voz permiten clonar una voz a partir de unos pocos segundos de audio de referencia, en todos los idiomas soportados, y Microsoft indica que incorporan barreras de consentimiento para prevenir el uso indebido.
¿Dónde están disponibles los modelos?
Los dos modelos de voz están disponibles vía OpenRouter, y los tres modelos a través de Microsoft Foundry, el MAI Playground y Vercel. También están en Azure Voice Live, y Microsoft indica que LiveKit llegará pronto. La compañía publicó además una demostración de agente en vivo llamada Chatter.
¿Sirven estos modelos para agentes de servicio al cliente?
Es uno de los tres usos que Microsoft nombra explícitamente como construibles hoy: agentes que transcriben el pedido mientras la persona lo dice, empiezan a actuar antes de que termine de hablar y responden con voz natural. Los otros dos son asistentes multilingües y contenidos interactivos de aprendizaje.
¿Qué debería revisar una empresa en Chile o Latinoamérica antes de desplegar un agente de voz?
El tramo intermedio del ciclo, que estos modelos no resuelven. La ganancia de latencia en oír y hablar se pierde si el agente debe consultar un CRM lento o con datos sucios para identificar a quien llama. Conviene medir primero el tiempo de respuesta de esas consultas y recién después elegir el modelo de voz.



¿Cómo se vive esto en tu equipo?
Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.
Cargando comentarios…