Por Canuto  

ElevenLabs presentó v4 y v4 Turbo con controles de expresión ampliados, menor latencia para agentes de voz y soporte para 90 idiomas. La actualización llega mientras la empresa expande su negocio corporativo y aumenta la competencia en el mercado de generación de voz con IA.
***

  • Los nuevos modelos permiten clonar una voz con 10 segundos de audio y seguir secuencias de etiquetas expresivas.
  • ElevenLabs amplió el soporte lingüístico de 70 a 90 idiomas y destacó mejoras en japonés, portugués de Brasil, mandarín y cantonés.
  • La compañía afirma que v4 reduce la latencia para agentes de voz, en un mercado donde también compiten startups y grandes tecnológicas.


ElevenLabs lanza v4 con más control expresivo y soporte para 90 idiomas

La compañía presentó dos modelos de voz, v4 y v4 Turbo, con una arquitectura que busca mejorar la clonación, la expresividad y la velocidad de respuesta para agentes conversacionales.

Una voz con más matices y control

ElevenLabs presentó el lunes 28 de septiembre sus modelos de voz v4 y v4 Turbo, una actualización que combina más herramientas para dirigir la expresión con soporte para más de 90 idiomas. La empresa también destacó una nueva arquitectura orientada a mejorar el control y acelerar la clonación de voces, dos capacidades que apuntan tanto a la creación de contenido como a la interacción con agentes de voz.

Una de las cifras centrales del lanzamiento es el tiempo de muestra necesario para clonar una voz: la compañía afirma que v4 puede hacerlo con apenas 10 segundos de audio. La reducción de esa barrera podría facilitar pruebas y producción para usuarios que no disponen de grabaciones extensas, aunque el material suministrado no detalla condiciones de uso, controles de consentimiento ni límites de la función.

En la generación de audio, ElevenLabs dice que el modelo conserva mejor la identidad de una voz cuando debe leer fragmentos de texto más largos. También puede atender al contexto del texto para ajustar la expresión durante la lectura, en lugar de mantener una interpretación uniforme de principio a fin; esto resulta especialmente relevante para narraciones que cambian de tono o intención.

El sistema de etiquetas en línea, introducido con la generación v3, también recibe cambios. Con v4, los usuarios pueden apilar varias etiquetas expresivas y pedir al modelo que siga esa secuencia, lo que amplía las instrucciones disponibles para marcar cómo debe sonar una intervención; la noticia no especifica qué etiquetas nuevas incluye ni ofrece resultados comparativos de calidad.

Más idiomas y respuestas más rápidas

La actualización eleva de 70 a 90 el número de idiomas admitidos, según la empresa. ElevenLabs señaló que observó sus mayores avances de calidad en japonés, portugués de Brasil, mandarín y cantonés, cuatro casos que destacan dentro de una expansión lingüística más amplia y que podrían interesar a quienes producen audio para públicos de distintos mercados.

El aumento de idiomas no equivale por sí solo a una calidad idéntica en todas las lenguas, y la información del lanzamiento no aporta métricas independientes para comparar resultados. La empresa sí identifica los idiomas donde percibió los mayores saltos, pero no publica en el material disponible cifras de precisión, naturalidad o desempeño que permitan medirlos frente a versiones anteriores.

ElevenLabs también presenta v4 como una opción para agentes de voz porque, de acuerdo con la compañía, tiene menor latencia y puede iniciar la generación de audio tan pronto como el modelo de lenguaje que lo respalda comienza a producir una respuesta. En una conversación, reducir la espera entre la intervención de una persona y la contestación sintética puede ayudar a que el intercambio se sienta más continuo.

El modelo, añade la empresa, puede tratar de manera diferenciada situaciones de confrontación, escaladas y espera, con el objetivo de mejorar la resolución de problemas. Esa capacidad apunta a conversaciones donde la forma de responder importa tanto como el contenido, aunque la fuente no detalla cómo se evalúan esos escenarios ni qué salvaguardas utiliza el sistema cuando una interacción se vuelve sensible.

Un mercado en expansión y con más rivales

El lanzamiento llega en medio de una competencia más intensa por desarrollar voces sintéticas expresivas. Entre las startups que trabajan en este campo figuran Cartesia, Deepgram, Fish Audio, Boson y WellSaid Labs, mientras Google y OpenAI también han mejorado sus modelos de voz, según el reporte de TechCrunch sobre la presentación.

La presión competitiva ayuda a explicar por qué la propuesta de ElevenLabs combina control creativo y capacidades para conversaciones en tiempo real. La compañía lanzó v3 el año anterior y presentó ese modelo en un evento celebrado en Varsovia a comienzos de 2026; v4 es la siguiente generación anunciada en esa secuencia, con cambios dirigidos tanto a la generación expresiva como a los agentes empresariales.

El negocio corporativo de llamadas de ElevenLabs creció con rapidez durante el último año. La empresa afirma que más del 55% de su negocio proviene de grandes compañías, una proporción que da contexto a su énfasis en la menor latencia y en el manejo de situaciones conversacionales diferenciadas, aunque el reporte no ofrece un desglose de ingresos por producto o tipo de cliente.

En el frente financiero, ElevenLabs recaudó USD $500 millones a comienzos de 2026 en una ronda liderada por Sequoia, que valoró a la compañía en USD $11.000 millones. También circulan versiones sobre una posible ronda posterior que elevaría la valoración a USD $22.000 millones, pero esa cifra aparece como un rumor y no como una operación confirmada por la empresa.

La tasa anualizada de ingresos recurrentes, o ARR, pasó de alrededor de USD $330 millones al inicio del año a más de USD $600 millones, de acuerdo con la información publicada. ElevenLabs también contrató personal de forma agresiva en India, Europa y Brasil, y alcanzó una plantilla superior a 800 empleados, cifras que describen una expansión paralela al crecimiento de sus productos.

El cofundador y CEO Mati Staniszewski dijo recientemente a TechCrunch que la compañía apunta a una oferta pública inicial en los próximos años, pero evitó comprometerse con un calendario. Por ahora, el lanzamiento de v4 y v4 Turbo amplía la oferta tecnológica de ElevenLabs; su impacto dependerá de cómo respondan clientes y competidores, y de la calidad que los usuarios obtengan en cada idioma y situación de uso.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín