Microsoft ha dado un paso firme en el terreno del reconocimiento de voz. El pasado 2 de octubre, la compañía presentó MAI-Transcribe-2-Streaming, junto con los modelos MAI-Transcribe y MAI-Voice. Con un precio de 0,54 dólares por hora, la propuesta busca posicionarse como una solución rápida, precisa y versátil para transcribir audio en condiciones reales.
MAI-Transcribe es un modelo de conversión de voz a texto (speech-to-text) desarrollado internamente por el equipo de Microsoft AI. Su objetivo es claro: ofrecer transcripciones precisas en 60 idiomas y en entornos auditivos difíciles, con funciones avanzadas que van desde la diarización de hablantes hasta el sesgo por palabras clave.
A continuación, repasamos qué ofrece este modelo, cómo se configura y para qué tipo de cargas de trabajo está pensado.
¿Qué es MAI-Transcribe-2?
MAI-Transcribe-2 es un modelo de transcripción de nueva generación diseñado para cubrir un amplio espectro de casos de uso:
- Subtitulado de vídeo
- Reuniones
- Notas clínicas
- Documentación de centros de llamadas
- Herramientas de accesibilidad
- Creación de contenido
- Agentes de voz
Además del modelo principal MAI-Transcribe-2, Microsoft mantiene MAI-Transcribe-1.5 y MAI-Transcribe-1, aunque este último quedó obsoleto el 20 de agosto de 2026. La recomendación es migrar a las versiones más recientes.
Funciones destacadas
El modelo no se limita a convertir voz en texto. Incorpora capacidades pensadas para escenarios profesionales:
- Diarización de hablantes: segmenta la grabación por hablante y atribuye cada segmento a la persona correcta, devolviendo metadatos de hablante, desplazamiento en milisegundos y duración.
- Marcas de tiempo a nivel de palabra: permite una alineación precisa, búsqueda, navegación y edición del texto.
- Sesgo por palabras clave: orienta el reconocimiento hacia terminología específica, abreviaturas, nombres de productos o nombres propios difíciles de distinguir por contexto.
- Estilos de transcripción: modo verbatim (captura el habla exactamente como se pronunció, con muletillas y arranques falsos) o modo clean (elimina muletillas para generar subtítulos legibles y transcripciones publicables).
- Selección de idioma: permite forzar un idioma concreto, aunque Microsoft advierte que es una sugerencia fuerte y solo debe usarse si se está completamente seguro.
- Cambio de código: maneja conversaciones que alternan entre idiomas a mitad de frase, como el Hinglish o el Spanglish.
- Robustez ante el ruido: mantiene la calidad en grabaciones fuera de entornos controlados, con ruido de fondo, voces superpuestas y micrófonos de calidad variable.
Configuración: los parámetros clave
Para usar MAI-Transcribe-2 es necesario configurar una serie de parámetros a través de la API. Estos son los más relevantes:
| Función | Parámetro | Valores | Predeterminado |
|---|---|---|---|
| Selección de modelo | enhancedMode.model | "MAI-Transcribe-2" | — |
| Modo mejorado | enhancedMode.enabled | true / false | false |
| Diarización | diarization.enabled | true / false | false |
| Marcas de tiempo | modelOptions.timestamps | "word" / "segment" / "none" | none |
| Palabras clave | phraseList.phrases | Array de strings | [] |
| Estilo | modelOptions.transcribeStyle | "verbatim" / "clean" | "verbatim" |
| Idioma | locales | ["language_code"] | Detección automática |
Un detalle importante: la diarización admite grabaciones más cortas que la transcripción sin diarización. Si se activa esta función, conviene revisar la nota sobre duración de grabación en la documentación oficial.
Requisitos previos
Antes de empezar a usar el modelo, hay que cumplir una serie de requisitos:
- Una suscripción de Azure (se puede crear una gratuita).
- Un recurso de Microsoft Foundry for Speech en el portal de Azure.
- La clave y la región del recurso Speech. Tras desplegarlo, se pueden ver y gestionar desde “Go to resource”.
- Un archivo de audio en formato WAV, MP3 o FLAC. Los límites de tamaño y duración dependen del parámetro de audio en la referencia REST de transcripciones.
Una vez cumplidos estos pasos, basta con especificar el modelo y configurar las funciones mediante los parámetros de la API correspondientes. Para empezar, Microsoft recomienda seguir primero el quickstart de LLM Speech.
¿Por qué importa este lanzamiento?
El mercado de la transcripción automática es competitivo, pero MAI-Transcribe-2-Streaming llega con varias ventajas claras:
- Precio agresivo: 0,54 dólares por hora lo sitúa como una opción competitiva frente a alternativas consolidadas.
- Cobertura lingüística amplia: 60 idiomas, con detección automática y soporte para cambio de código.
- Funciones profesionales: diarización, marcas de tiempo por palabra, estilos configurables y sesgo por palabras clave cubren las necesidades de sectores como salud, legal, medios o atención al cliente.
- Robustez en condiciones reales: no está pensado solo para estudios de grabación, sino para audio del mundo real, con ruido y voces superpuestas.
Conclusión
Con MAI-Transcribe-2-Streaming, Microsoft refuerza su apuesta por la IA conversacional y de voz con un modelo pensado para producción. Su combinación de precio, cobertura de idiomas y funciones avanzadas lo convierte en una herramienta atractiva tanto para desarrolladores como para empresas que necesitan transcribir audio a escala.
Si trabajas con audio —reuniones, llamadas, vídeos o notas clínicas—, este modelo merece un lugar en tu lista de opciones a evaluar. La transcripción automática sigue madurando, y propuestas como esta demuestran que la precisión y la versatilidad ya no son un lujo reservado a unos pocos.
Descubre más desde CIBERED
Suscríbete y recibe las últimas entradas en tu correo electrónico.


