IA en Ventas

MAI-Transcribe-2 es el modelo de reconocimiento de voz más rápido, preciso y barato del mundo

Microsoft lanzó MAI-Transcribe-2 a US$0,10 por hora de audio, con 5,2% de tasa de error en 60 idiomas y hasta 10 veces más velocidad que GPT-Transcribe. La transcripción deja de ser una línea relevante en el presupuesto de un equipo comercial.

5 min de lecturaFuente: Microsoft AI
Gráfica de lanzamiento de MAI-Transcribe-2 de Microsoft con el lema velocidad, precisión y eficiencia en un solo modelo
Imagen: Microsoft AI

La noticia en 30 segundos

Microsoft lanzó el 3 de septiembre de 2026 MAI-Transcribe-2, su modelo de transcripción de audio. Cuesta US$0,10 por hora de audio, promedia 5,2% de tasa de error de palabra en 60 idiomas del benchmark FLEURS y corre hasta 10 veces más rápido que GPT-Transcribe, 7 veces más que ElevenLabs Scribe v2 y 5 veces más que Gemini 3.5 Transcribe. Incluye diarización de hablantes, marcas de tiempo por palabra y cambio de idioma dentro de una misma frase, como el spanglish. Está disponible en Microsoft Foundry, MAI Playground y OpenRouter.

Microsoft presentó MAI-Transcribe-2, el nuevo modelo de reconocimiento de voz de su laboratorio Microsoft AI, con un argumento poco habitual: dice ser simultáneamente el más preciso, el más rápido y el más barato del mercado. El anuncio se publicó el 3 de septiembre de 2026 en el blog oficial de Microsoft AI.

El modelo queda primero en el benchmark público multilingüe FLEURS con una tasa de error de palabra promedio de 5,2% en 60 idiomas, define la frontera de Pareto de precisión y latencia en las evaluaciones de Artificial Analysis y aparece segundo en la tabla de tasa de error de esa misma casa. Microsoft afirma que supera a Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large y ScribeV2.

¿Cuánto cuesta MAI-Transcribe-2?

El precio de lanzamiento es de US$0,10 por hora de audio, presentado como oferta por tiempo limitado hasta fin de año. Para dimensionar: un equipo comercial que graba 500 horas de llamadas al mes pasa a gastar US$50 mensuales en la capa de transcripción pura. Ese número cambia la conversación sobre qué se graba y qué no.

¿Qué trae además del precio?

  • Diarización de hablantes: separa quién dijo qué dentro de una grabación, condición mínima para analizar una llamada de descubrimiento o una reunión de negociación.
  • Marcas de tiempo por palabra, que habilitan búsqueda, navegación y edición precisas sobre el audio.
  • Keyword biasing: se le puede indicar terminología propia, siglas y nombres de producto o de cuenta que el modelo suele confundir por contexto.
  • Estilos configurables: el modo «verbatim» conserva muletillas y frases cortadas para casos de cumplimiento y análisis; el modo «clean» las elimina para producir notas y subtítulos legibles.
  • Cambio de idioma dentro de una frase, con soporte explícito a combinaciones como el spanglish y el hinglish.
  • Identificación automática de idioma y desempeño sostenido en condiciones de ruido.

¿Por qué el cambio de idioma importa en Chile y Latinoamérica?

El soporte explícito a spanglish no es un detalle cosmético para la región. En equipos comerciales de Chile, México, Colombia o Argentina que venden software B2B, una llamada real mezcla castellano con vocabulario técnico en inglés sin previo aviso: pipeline, forecast, churn, onboarding, deal. Los modelos de transcripción que asumen un solo idioma por archivo degradan justo en esas palabras, que suelen ser las que uno necesita buscar después.

Microsoft también argumenta que cubrir 60 idiomas con un solo modelo reduce complejidad para quien opera en varios mercados: una sola integración en vez de un modelo por país.

¿Dónde se puede usar hoy?

MAI-Transcribe-2 está disponible a través de Microsoft Foundry, del MAI Playground y de OpenRouter. Esta última vía es relevante porque permite probarlo sin comprometerse con la infraestructura de Azure, algo práctico para equipos pequeños en Latinoamérica que quieren medir calidad antes de migrar un flujo productivo.

Análisis de Revenue Hub

La noticia real aquí no es el benchmark, es el precio. Durante años la transcripción de llamadas fue una función que se compraba empaquetada dentro de una herramienta de conversation intelligence, con el costo escondido en la licencia por usuario. Cuando la transcripción cruda vale US$0,10 la hora, el valor de esos productos deja de estar en transcribir y pasa a estar en lo que hacen con el texto: detectar riesgo en un negocio, poblar campos del CRM sin que nadie escriba, entrenar a un vendedor con evidencia de sus propias llamadas.

Para un líder comercial en Chile o Latinoamérica esto abre una decisión concreta y de bajo riesgo: dejar de tratar la grabación de llamadas como un privilegio de los negocios grandes. Si el costo marginal de transcribir es casi cero, la pregunta pasa a ser de gobierno de datos, no de presupuesto. Quién puede escuchar qué, qué se guarda, por cuánto tiempo y con qué consentimiento del cliente. Recomendamos definir esa política antes de encender la grabación masiva, no después, porque revertirla es mucho más caro que planificarla.

La segunda implicancia es de arquitectura. Si tu CRM ya captura transcripciones vía un notetaker propietario, conviene verificar si puedes exportar el texto y no solo consultarlo dentro de la herramienta. El texto de tus llamadas es el activo; la herramienta que lo generó es reemplazable. Ese criterio es el mismo que aplicamos al evaluar stacks de CRM y datos y lo tratamos con más profundidad en nuestro blog.

Fuente y criterio editorial

Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a Microsoft AI.

Leer la fuente original

Para profundizar

Preguntas frecuentes

¿Cuánto cuesta MAI-Transcribe-2?

US$0,10 por hora de audio en el lanzamiento, presentado por Microsoft como una oferta por tiempo limitado hasta fin de 2026. Es el precio más bajo del mercado entre los modelos de transcripción comerciales comparables.

¿MAI-Transcribe-2 es mejor que Whisper?

Según las cifras publicadas por Microsoft, sí en precisión y velocidad: supera a Whisper V3-Large, además de Gemini 3.5 Transcribe, GPT-Transcribe y ScribeV2. Whisper sigue teniendo la ventaja de poder ejecutarse localmente sin costo por hora, algo que MAI-Transcribe-2 no ofrece.

¿Qué tan preciso es MAI-Transcribe-2?

Promedia 5,2% de tasa de error de palabra en el benchmark público FLEURS, que cubre 60 idiomas, y queda en primer lugar. En la tabla de tasa de error de Artificial Analysis aparece segundo, y define la frontera de Pareto entre precisión y latencia.

¿Sirve para transcribir llamadas de ventas en español?

Sí. Cubre 60 idiomas incluido el español y soporta cambio de idioma dentro de una misma frase, con mención explícita al spanglish. Eso es relevante para equipos comerciales en Chile y Latinoamérica que mezclan castellano con vocabulario técnico en inglés.

¿MAI-Transcribe-2 separa quién habla en una grabación?

Sí, incluye diarización de hablantes, que atribuye cada palabra a la persona correspondiente dentro de la grabación. También entrega marcas de tiempo por palabra para buscar y navegar el audio con precisión.

¿Dónde se puede probar MAI-Transcribe-2?

Está disponible en Microsoft Foundry, en el MAI Playground de Microsoft y en OpenRouter. La vía de OpenRouter permite evaluarlo sin adoptar la infraestructura de Azure.

¿Qué diferencia hay entre el modo verbatim y el modo clean?

El modo verbatim conserva el habla tal como ocurrió, con muletillas y frases cortadas, y sirve para cumplimiento y análisis conversacional. El modo clean las elimina para producir subtítulos, notas y transcripciones publicables más legibles.

¿Qué significa esto para las herramientas de conversation intelligence?

Presiona su propuesta de valor. Si transcribir cuesta casi nada, esas plataformas dejan de competir por la transcripción y pasan a competir por lo que hacen con el texto: señales de riesgo en negocios, actualización automática del CRM y coaching basado en evidencia.

Comparte este análisis con tu equipo

Continúa explorando

Ver toda la categoría