El gigante tecnológico Microsoft lanzó un nuevo modelo de conversión de texto a voz en tiempo real: VibeVoice-Realtime. Esta IA se basa en el texto que le des para generar audios de hasta 90 minutos. Lee más ¡acá!

A esta altura del partido, ya no debería sorprendernos que la IA haga cada vez más cosas por nosotros. Ya genera imágenes, videos, textos, música y hasta inicia conversaciones en apps de citas. Otro de los modelos más comunes hoy en día es el de conversión de texto a voz, aunque muchos dudan en usarlos con frecuencia porque no suelen sonar muy naturales. Sin embargo, este mes, Microsoft sorprendió a más de uno con su nuevo VibeVoice-Realtime-0.5B, una herramienta que puede generar audios de voz natural en tiempo real.
¿Qué puede hacer VibeVoice-Realtime de Microsoft?
Según describió Microsoft, VibeVoice-Realtime es un modelo ligero de conversión de texto a voz en tiempo real capaz de transformar un texto, guion o lo que se te ocurra escribir a una voz natural y prácticamente fluida. Lo sorprendente de esta herramienta no sólo es su variedad de tonos de voz y entonaciones, sino la rapidez con la que genera el audio, que puede durar hasta 90 minutos. ¿De cuánto tiempo de latencia hablamos? 300 milisegundos desde que enviamos el prompt hasta que genera la voz.

Este modelo de síntesis de voz TTS (en inglés «Text to speech») puede generar audios de hasta 90 minutos de manera continua gracias a que cuenta con sólo 0.5B de parámetros. Todo con una voz clara y entonación coherente, aunque, para tranquilidad de muchos, todavía no puede igualar la naturalidad y sutilezas de las voces humanas, como entonaciones, emociones o algo tan común como respiraciones.
Sin embargo, esta herramienta puede ser muy útil para todo tipo de contenido con voz: desde narraciones y audiolibros, hasta podcasts, diálogos ficticios o entrevistas simuladas. Al ser un modelo gratuito y de licencia abierta, sólo lo tenés que descargar en el github de Microsoft para luego compartirle un guion o texto, elegir qué tipo de voz te gustaría que tenga y esperar poco para ya tener tu audio. Cabe destacar que el modelo está diseñado principalmente para inglés, aunque funciona razonablemente bien en alemán, francés, italiano, japonés, coreano, neerlandés, polaco, portugués y español.

Para ahorrarse algunos problemas, Microsoft aclaró en el lanzamiento que VibeVoice-Realtime no debe usarse para deepfakes, suplantaciones, producir contenido engañoso, fraude, en contextos de desinformación u otros casos ilegales.
Si te sirvió esta nota, marcanos como fuente preferida y vas a ver más de Cultura Geek cuando busques en Google.Sumá
como fuente preferida en ![]()
