Por Canuto  

Alibaba amplió su plataforma Qwen con cinco modelos especializados en reconocimiento de voz, síntesis y conversación en tiempo real, mientras anunció reducciones de hasta 95% en sus precios. La actualización también incorpora identificación de hablantes, detección de emociones y control de estilo mediante instrucciones de texto.
***

  • Qwen-Audio-3.1 reúne cinco modelos para reconocimiento de voz, texto a voz e interacción en tiempo real.
  • ASR-Next identifica a varios hablantes, agrega marcas de tiempo y detecta emociones, sonidos ambientales y ruido de máquinas.
  • Alibaba anunció recortes de aproximadamente 70% en TTS, 85% en Realtime y hasta 95% en ASR.


Alibaba presentó Qwen-Audio-3.1, una nueva familia de cinco modelos de inteligencia artificial orientados al procesamiento y la generación de audio. La propuesta cubre reconocimiento automático de voz, conversión de texto a voz e interacción bidireccional en tiempo real, con herramientas dirigidas tanto a desarrolladores como a usuarios que buscan mayor control sobre la producción sonora.

La actualización llega acompañada de una reducción importante en las tarifas de la plataforma Qwen Cloud, según informó The Decoder a partir de los anuncios del equipo de IA de Alibaba. Los recortes alcanzan aproximadamente 70% para el modelo de síntesis de voz, 85% para la modalidad en tiempo real y hasta 95% para el reconocimiento automático de voz, una diferencia que podría intensificar la competencia entre proveedores de servicios de audio generativo.

Además del componente de precios, Qwen-Audio-3.1 amplía las funciones disponibles para trabajar con conversaciones, grabaciones y voces sintéticas. Alibaba destacó mejoras en el reconocimiento multilingüe y de dialectos, junto con capacidades para eliminar automáticamente muletillas y repeticiones que suelen aparecer en el habla espontánea.

Una familia de modelos para comprender y generar voz

El modelo de reconocimiento automático de voz, conocido como ASR, está diseñado para convertir audio hablado en texto con mayor cobertura de idiomas y dialectos. La herramienta también limpia el resultado al retirar expresiones repetitivas y muletillas, una función relevante para quienes procesan entrevistas, reuniones, llamadas de atención al cliente o contenidos destinados a publicación.

Qwen también presentó ASR-Next, una variante con capacidades más amplias para analizar grabaciones complejas. El modelo puede distinguir a múltiples hablantes, incorporar marcas de tiempo y detectar señales asociadas con emociones, sonidos ambientales y ruido producido por máquinas, lo que permite extraer información adicional más allá de la transcripción literal.

En la práctica, esa combinación puede ayudar a separar las intervenciones de cada participante y ubicar con precisión cuándo ocurre una frase o un evento sonoro. La identificación de sonidos no convierte por sí sola una grabación en un análisis completo, pero ofrece una capa de contexto que puede ser útil en operaciones industriales, soporte técnico y revisión de conversaciones.

La familia se completa con modelos de texto a voz y una modalidad de interacción instantánea. El sistema TTS genera habla en varios idiomas y permite transferir una voz entre lenguas de manera natural, mientras que las instrucciones escritas sirven para definir aspectos como la emoción, la velocidad y el estilo de la interpretación.

Control expresivo y audio generado en una sola pasada

El control mediante texto busca que el usuario pueda modificar la forma de una lectura sin tener que ajustar manualmente numerosos parámetros técnicos. Una instrucción como “Lee esto con un tono severo y contundente, exigiendo respeto” puede orientar la interpretación hacia una emoción y una actitud concretas, de acuerdo con la descripción divulgada por Qwen.

Esta posibilidad amplía el uso de la síntesis de voz más allá de la conversión mecánica de palabras escritas. Un creador podría solicitar una lectura más pausada, enérgica o severa, aunque el resultado final dependerá de la capacidad del modelo para comprender la instrucción y mantener una pronunciación consistente en diferentes idiomas.

TTS-Next combina un modelo de lenguaje con un enfoque de difusión para producir voz, efectos de sonido y audio de fondo en una sola pasada. La arquitectura apunta a simplificar flujos de trabajo que normalmente requieren varias herramientas separadas, especialmente cuando una pieza necesita narración, ambientación y elementos sonoros coordinados.

La modalidad en tiempo real añade una interacción en la que el sistema puede escuchar y hablar simultáneamente, con interrupción inmediata cuando el usuario toma la palabra. Qwen señaló que, si detecta un estado de ánimo bajo, el asistente responde con mayor lentitud y empatía, una conducta que busca hacer más natural la conversación y adaptar el ritmo a la situación emocional percibida.

Una guerra de precios en los servicios de audio con IA

La reducción de tarifas constituye uno de los anuncios más relevantes de Qwen-Audio-3.1 porque afecta directamente el costo de experimentar y desplegar aplicaciones basadas en voz. Alibaba indicó que TTS será alrededor de 70% más barato, que Realtime tendrá una rebaja aproximada de 85% y que ASR podrá costar hasta 95% menos.

El mayor recorte corresponde al reconocimiento automático de voz, una categoría utilizada para transcribir contenido, automatizar registros y alimentar sistemas de atención al cliente. Si la disminución se refleja de manera consistente en los distintos niveles de uso, empresas pequeñas y desarrolladores independientes podrían probar más aplicaciones sin asumir desde el comienzo el costo de una infraestructura de audio intensiva.

Sin embargo, una tarifa más baja no garantiza por sí misma una adopción masiva ni un rendimiento superior en todos los escenarios. La utilidad real dependerá de factores como la precisión con acentos y dialectos, la estabilidad durante conversaciones largas, la latencia, la calidad de la transferencia de voz y la claridad de las condiciones comerciales de Qwen Cloud.

La competencia también obligará a evaluar cómo se gestionan la privacidad, el consentimiento y la seguridad de las voces utilizadas por estos sistemas. La información divulgada sobre Qwen-Audio-3.1 describe sus capacidades y precios, pero no detalla en el material disponible las políticas específicas para cada caso de uso, por lo que los implementadores deberán revisar esos aspectos antes de incorporar grabaciones sensibles.

Qué significa la actualización para desarrolladores y usuarios

La integración de reconocimiento, síntesis y conversación en una misma familia puede reducir la complejidad de construir productos de voz. En lugar de combinar servicios inconexos para transcribir una grabación, generar una respuesta y reproducirla con una determinada emoción, un equipo podría explorar un flujo más integrado dentro del ecosistema de Qwen.

Los avances en varios hablantes y marcas de tiempo resultan especialmente importantes para reuniones, entrevistas y archivos con conversaciones superpuestas. Aun así, la identificación automática debe considerarse una asistencia tecnológica y no una prueba definitiva de quién habló o qué emoción experimentaba, porque el ruido, la calidad del micrófono y el contexto pueden alterar la interpretación.

La transferencia de voz entre idiomas también abre oportunidades para doblaje, educación y accesibilidad, al permitir que una identidad vocal conserve rasgos reconocibles al cambiar de lengua. Esa capacidad, no obstante, plantea la necesidad de obtener autorizaciones claras cuando se imita o transforma la voz de una persona, sobre todo en contenidos públicos y aplicaciones comerciales.

Con Qwen-Audio-3.1, Alibaba presenta el audio como una pieza central de su estrategia de inteligencia artificial y no solo como una función complementaria de sus modelos de lenguaje. El lanzamiento combina una mayor variedad de herramientas con una política de precios agresiva, mientras el mercado deberá comprobar si la promesa de menor costo se mantiene junto con la calidad, la velocidad y la confiabilidad necesarias para aplicaciones reales.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín