Fish Audio obtuvo USD $52 millones en una ronda inicial tras alcanzar 8 millones de usuarios y USD $21 millones en ingresos recurrentes anuales. La startup busca competir en la IA de voz con modelos más expresivos y controlables, mientras enfrenta el desafío de proteger el consentimiento de los artistas.
***
- Fish Audio recaudó USD $52 millones en una ronda inicial liderada por Coreline Ventures y Capital Today.
- La startup suma más de 8 millones de usuarios y genera USD $21 millones en ingresos recurrentes anuales.
- La empresa automatizó el retiro de voces cuestionadas, aunque los reclamos por consentimiento todavía representan un riesgo.
Fish Audio recauda USD $52 millones para construir modelos de voz con IA
Fish Audio recaudó USD $52 millones en una ronda de financiamiento inicial para desarrollar modelos de voz con inteligencia artificial dirigidos a creadores y empresas. La startup, con sede en Palo Alto, anunció la operación el martes 28 de julio de 2026.
Una apuesta por voces más expresivas y controlables
El mercado de las voces generadas por IA reúne necesidades distintas. Los creadores buscan modelos capaces de transmitir emociones y personalidad, mientras las empresas priorizan herramientas que puedan dirigir para atención al cliente y operaciones de ventas.
Fish Audio intenta atender ambos segmentos mediante una biblioteca de más de 15.000 controles de lenguaje natural. Estas herramientas permiten ajustar aspectos de la voz y acercar el resultado a las necesidades de cada aplicación.
La compañía informó que sus versiones de modelos de código abierto y sus productos alojados ya son utilizados por más de 8 millones de personas. También genera USD $21 millones en ingresos recurrentes anuales.
La ronda fue liderada por Coreline Ventures y Capital Today. En la operación también participaron 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0.
Osuke Honda, socio de Coreline Ventures, señaló que el modelo impulsado por la comunidad solo puede convertirse en una ventaja duradera si los creadores confían en la plataforma. A su juicio, el consentimiento, la transparencia y la atribución deben formar parte del producto desde el inicio.
Del proyecto de código abierto a una compañía de IA
Fish Audio comenzó como un proyecto pequeño de Shijia Liao, exinvestigador de NVIDIA. Liao estaba frustrado por la falta de expresividad en las voces sintéticas disponibles y entrenó un modelo de generación de voz usando una sola GPU.
El investigador publicó aquel modelo como código abierto. Con el tiempo, el repositorio Fish Speech en GitHub superó las 31.000 estrellas y atrajo a desarrolladores independientes, diseñadores de videojuegos y creadores.
Durante el último año, la empresa lanzó cinco modelos. Cuatro corresponden a generación de voz y uno se enfoca en la conversión de voz a texto.
Fish Audio convirtió tres de sus modelos de generación de voz en proyectos de código abierto. Sin embargo, su modelo más reciente, S2.1 Pro, solo está disponible mediante una API de pago.
La startup ofrece planes mensuales para creadores y equipos. Los paquetes desbloquean una cantidad definida de minutos de generación e incluyen funciones de clonación de voz.
Además, Fish Audio comercializa una versión empresarial de sus API y de su plataforma. La compañía afirma que organizaciones como HeyGen y Sanas ya utilizan sus productos.
Aplicaciones para avatares, videojuegos y llamadas
Las preferencias de los clientes cambian según el uso final. Las compañías que desarrollan avatares de IA buscan voces realistas, mientras los estudios de videojuegos necesitan interpretaciones expresivas para sus personajes.
Rissa Cao, CEO y cofundadora de Fish Audio, explicó que las empresas como HeyGen utilizan las voces para alimentar avatares de IA. En ese caso, el realismo ocupa un lugar central.
Los estudios de videojuegos requieren otro tipo de rendimiento. Sus personajes necesitan voces con mayor expresividad para comunicar estados de ánimo y reforzar la experiencia narrativa.
Las compañías dedicadas a agentes de voz, como LiveKit, priorizan una combinación diferente. Buscan voces naturales, con baja latencia y suficiente expresividad para conversaciones telefónicas.
Esta variedad explica la estrategia de Fish Audio. La empresa intenta ofrecer controles detallados para desarrolladores, en vez de concentrarse en una única voz o en un solo flujo de trabajo.
Rico Mallozzi, socio de 359 Capital, consideró que esos controles pueden ayudar a la startup a competir con grandes laboratorios de IA. También destacó el entrenamiento rentable de los modelos como una posible ventaja.
El reto del consentimiento y la propiedad de las voces
Una parte de la biblioteca de voces de Fish Audio se construyó con muestras enviadas por los propios usuarios. La compañía compensa a los participantes cuando utiliza sus voces para entrenar modelos.
El sistema enfrentó problemas hace algunos meses. Algunos creadores afirmaron que sus voces fueron subidas a Fish Audio sin autorización.
La empresa ya contaba con un proceso de retiro de contenido basado en la Ley de Derechos de Autor del Milenio Digital de Estados Unidos, conocida como DMCA. No obstante, los retiros podían tardar demasiado tiempo.
Cao indicó que Fish Audio automatizó el proceso de eliminación. Los creadores pueden enviar una muestra breve de voz o un contrato que demuestre la propiedad, y la startup asegura que retirará el material en menos de tres minutos.
La automatización reduce el tiempo de respuesta, pero no elimina por completo el riesgo. Alguien todavía podría subir la voz de un artista sin su conocimiento, y el material permanecería disponible hasta que el afectado lo descubra y presente una solicitud.
Honda planteó que la industria necesita avanzar hacia una propiedad de voz verificada y términos de licencia claros. También mencionó procesos sencillos de reporte y eliminación, junto con posibles modelos de participación en los ingresos.
Con ese esquema, los creadores podrían recibir beneficios económicos cuando sus voces se licencien o se utilicen comercialmente. La propuesta vincula el crecimiento de la IA de voz con una mayor protección para las personas cuya identidad sonora alimenta los modelos.
Capital para ampliar los modelos y enfrentar la competencia
Cao explicó que Fish Audio operaba de manera eficiente cuando solo ofrecía un proyecto de código abierto y planes dirigidos a creadores. En ese momento, la empresa no necesitaba capital externo para mantener sus actividades.
La startup decidió buscar financiamiento cuando quiso desarrollar modelos más avanzados y atender a clientes empresariales. El interés creciente de los inversores también influyó en esa decisión.
La competencia en generación de voz es intensa. ElevenLabs, WellSaid, Cartesia, Speechify, Async, anteriormente conocida como Podcastle, y Krisp también buscan captar el gasto de creadores y empresas.
Mallozzi sostuvo que Fish Audio logró construir modelos de última generación con un equipo más pequeño que varios laboratorios y compañías de IA con abundante financiamiento. Según el inversor, ese resultado muestra capacidad técnica para reducir la distancia entre una voz artificial y una voz humana.
La compañía planea lanzar este año un modelo de comprensión de audio. También trabaja en un modelo de conversación de voz a voz.
Esos productos ampliarían el alcance de la startup más allá de la generación de voces. La comprensión de audio y las conversaciones de voz a voz podrían abrir nuevas aplicaciones para asistentes, agentes empresariales y herramientas creativas.
El financiamiento ofrece recursos para acelerar esa hoja de ruta. Sin embargo, el crecimiento dependerá tanto del desempeño técnico como de la confianza que Fish Audio logre construir entre los creadores.
La empresa enfrenta una tensión común en la inteligencia artificial. Necesita reunir grandes cantidades de datos y voces para mejorar sus modelos, pero también debe demostrar que obtiene esos materiales con autorización y bajo condiciones comprensibles.
La rapidez de los retiros puede ayudar a responder a los reclamos después de que ocurran. El desafío más amplio consiste en crear mecanismos que identifiquen la propiedad y el consentimiento antes de que una voz llegue a la plataforma.
La ronda inicial de USD $52 millones marca una nueva etapa para Fish Audio. La startup comenzó con un modelo desarrollado en una sola GPU y ahora busca consolidarse en un mercado donde los avances de la IA conviven con disputas sobre identidad, derechos y control creativo.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
El sarampión alcanza un máximo de 35 años en EE. UU. y activa la carrera por nuevos tratamientos
Hyperscalers
Recursive Superintelligence firma acuerdo de computación por USD $400 millones con AWS
Energía
Starship enfrenta un obstáculo crítico en su escudo térmico para lograr la reutilización rápida
Empresas