Por Canuto  

Google presentó Gemini 3.8 Flash TTS y Flash-Lite TTS, dos modelos que permiten diseñar voces desde cero, replicarlas con consentimiento y dirigir conversaciones línea por línea en más de 100 idiomas.
***

  • Gemini 3.8 Flash TTS permite crear voces personalizadas, controlar acentos y dirigir emociones mediante instrucciones en lenguaje natural.
  • Flash-Lite TTS está orientado a doblaje, contenido de audio y agentes de voz que necesitan operar a gran escala y con menor costo.
  • Google incorporó verificación de consentimiento, marcas de agua SynthID y credenciales C2PA para reforzar la transparencia del audio generado.


Google presentó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos nuevos modelos de texto a voz concebidos para producir interpretaciones más expresivas y personalizables. La compañía los ubica dentro de su familia Gemini Audio y los orienta a creadores, desarrolladores y empresas que necesitan generar audiolibros, podcasts, doblajes y agentes de voz con una calidad consistente.

La novedad central no consiste únicamente en convertir palabras escritas en audio, sino en permitir que los usuarios dirijan la actuación como si trabajaran con un estudio vocal. Las instrucciones pueden definir el acento, el ritmo, el tono emocional y las reacciones conversacionales, mientras que las herramientas de seguridad buscan limitar los riesgos asociados con la réplica de voces y la circulación de contenido sintético.

Diseño vocal y control de personajes

Gemini 3.8 Flash TTS está diseñado para crear voces completamente nuevas a partir de indicaciones en lenguaje natural, sin depender exclusivamente de un conjunto fijo de voces preestablecidas. Según la información publicada por Google, el usuario puede describir el papel, el acento y las características de una voz en más de 100 idiomas y dialectos, desde un narrador regional hasta un personaje fantástico.

El modelo también ofrece acceso a una biblioteca de más de 2.000 voces listas para producción, con variedades como español mexicano, francés de Quebec e inglés escocés. Esa cobertura puede facilitar la localización de contenidos para distintas audiencias, aunque la calidad final dependerá del guion, la dirección de la interpretación y el caso de uso elegido por cada desarrollador.

La plataforma permite además replicar un perfil vocal a partir de una muestra de audio de apenas 30 segundos, siempre que el usuario tenga derechos para utilizar esa voz. El proceso incorpora una verificación verbal de consentimiento que debe coincidir con el hablante de referencia, una medida destinada a reducir el riesgo de suplantaciones no autorizadas.

Google también anunció funciones para guardar y administrar voces personalizadas, con el objetivo de mantener un timbre estable en proyectos prolongados y disminuir la deriva del hablante. La posibilidad de modificar posteriormente el timbre, el tono, el ritmo o el acento mediante instrucciones, descrita como remix de voz, llegará próximamente según la compañía.

Diálogos, emociones y generación a escala

Una vez seleccionada la voz, los dos modelos permiten dirigir la interpretación línea por línea mediante acotaciones de escena o instrucciones integradas en el guion. Esto abre la puerta a controlar elementos como el ritmo, los cambios de dialecto, el tono emocional y las señales de escucha activa, con diferencias entre una respuesta calmada de servicio al cliente y una escena de suspenso susurrada.

Los guiones pueden incluir sonidos conversacionales no verbales, como risas, suspiros y jadeos, además de interjecciones de escucha activa como asentimientos o respuestas breves. Estas funciones buscan añadir una textura más natural al diálogo y dar a los creadores mayor precisión para construir reacciones, pausas y momentos cómicos sin editar manualmente cada fragmento.

Otra capacidad destacada es la escenificación nativa de conversaciones con dos hablantes desde un único guion. El sistema puede alternar las voces en intercambios de varios turnos, una función pensada para podcasts, narrativas dramáticas y experiencias interactivas que necesitan conservar la identidad de cada personaje a lo largo de la escena.

La generación de formato largo apunta a mantener el timbre, la calidad vocal y un ritmo natural durante horas de audio continuo, algo especialmente relevante para audiolibros y programas de conversación. En paralelo, Gemini 3.8 Flash-Lite TTS está optimizado para volúmenes elevados y una operación rentable, con aplicaciones en doblaje masivo, producción de contenido y agentes de voz expresivos.

Rendimiento, disponibilidad y seguridad

La empresa asegura que Gemini 3.8 Flash TTS obtuvo el primer lugar general en el Voice Design Benchmark de Hume AI, con una puntuación de 71,4, y también lideró la categoría de modelado de acentos, con 60,8. En el Overall Quality Index de esa evaluación, Flash TTS y Flash-Lite TTS ocuparon, respectivamente, las posiciones primera y segunda, de acuerdo con los datos divulgados.

Google afirmó que los modelos mostraron mejoras frente a Gemini 3.1 Flash TTS en contenido de formato largo y control de guiones con dos hablantes. También señaló que ambos lograron posiciones destacadas en evaluaciones ciegas de preferencia humana para japonés, portugués de Brasil, vietnamita, árabe estándar moderno, español mexicano e hindi.

La disponibilidad comenzó en Google AI Studio y en la Gemini API para desarrolladores, mientras que el acceso para empresas llegará próximamente a través de la API de Gemini Enterprise. Gemini 3.8 Flash TTS también se está incorporando a Gemini Notebook, y Flash-Lite TTS llegará a Google Vids, con lo que las herramientas se distribuyen entre espacios de creación, productividad y desarrollo.

Para ampliar el despliegue de interfaces de voz, la compañía mencionó colaboraciones con Agora, LiveKit, Pipecat y Vercel, además de integraciones con Figma, HeyGen, Linguana, Wondercraft, 99.co y Ollang. Esas alianzas están enfocadas en casos como el doblaje global, la localización con acentos regionales y los agentes conversacionales de alto volumen, aunque la publicación no detalló condiciones comerciales ni fechas específicas para cada integración.

El esquema de protección incluye SynthID, una marca de agua imperceptible incorporada directamente en cada clip de audio generado por los modelos Gemini Audio. La compañía también menciona credenciales C2PA para respaldar la procedencia del contenido y sostiene que estas herramientas pueden ayudar a detectar habla creada con IA, una necesidad creciente ante el riesgo de desinformación y falsificación de identidades.

El lanzamiento refleja el desplazamiento de la síntesis de voz desde los ajustes predeterminados hacia sistemas capaces de seguir una dirección creativa detallada. Para los desarrolladores, la combinación de personalización, generación prolongada y operación multilingüe puede reducir barreras de producción, mientras que la réplica vocal exige mantener controles estrictos sobre permisos, consentimiento y trazabilidad.

Los usuarios pueden probar el nuevo espacio de generación de voz en Google AI Studio, donde es posible diseñar identidades vocales o replicar una voz propia autorizada y llevarla a un editor de guiones con dos hablantes. La evolución de estas herramientas dependerá tanto de su desempeño técnico como de la capacidad de las plataformas para demostrar que las voces utilizadas pertenecen a talentos que aprobaron su reproducción.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín