Por Canuto  

Voicebox es una aplicación de escritorio de código abierto que permite clonar voces, generar habla, dictar y conectar agentes de inteligencia artificial, todo de forma local y sin suscripciones.
***

  • La aplicación funciona en macOS, Windows y Linux, con inferencia local mediante Metal, CUDA, ROCm, Intel Arc o DirectML.
  • Voicebox puede clonar una voz desde tres segundos de audio, transcribir con Whisper y generar hasta 50.000 caracteres por sesión.
  • Su integración con MCP permite que agentes como Claude Code, Cursor y Cline respondan mediante perfiles de voz creados por el usuario.


Voicebox propone una alternativa local para la voz generativa

Voicebox se presenta como un estudio de voz con inteligencia artificial de código abierto. La aplicación permite clonar voces, generar habla mediante siete motores de texto a voz, dictar en cualquier programa y dar voz a agentes digitales.

Su propuesta busca diferenciarse de servicios como ElevenLabs y WisprFlow mediante una operación totalmente local. El procesamiento ocurre en la propia computadora, sin depender de una nube, suscripciones o límites por cantidad de caracteres.

La herramienta está disponible para macOS, Windows y Linux. En su versión 0.2.0, también ofrece inferencia con GPU mediante Metal, CUDA, ROCm, Intel Arc o DirectML, además de la posibilidad de conectarse a una máquina remota.

El proyecto asegura que Voicebox superó 1 millón de descargas. La plataforma se distribuye como software gratuito y de código abierto, aunque su sitio también presenta un token opcional denominado $VOICEBOX en Solana.

La empresa aclara que el token no es necesario para utilizar ninguna función. Según la presentación del proyecto, Voicebox seguirá siendo gratuito y de código abierto, mientras que el activo busca respaldar la iniciativa y ofrecer una alternativa recreativa a su comunidad.

Clonación de voces, dictado y producción de audio

Voicebox puede crear un perfil de voz a partir de un clip de audio, una grabación de micrófono o una captura del sonido reproducido por el sistema. La clonación requiere tan solo tres segundos de audio, mientras que la grabación directa admite hasta 30 segundos.

Los usuarios pueden subir archivos WAV, MP3, FLAC o WebM. También cuentan con una vista previa de forma de onda durante la grabación y una opción para capturar el audio de un video, un pódcast o cualquier aplicación que reproduzca sonido.

El programa incluye un editor de historias basado en una línea de tiempo. Allí se pueden organizar pistas, recortar clips y mezclar conversaciones entre varios personajes, una función orientada a guiones, narrativas, juegos y otros proyectos con múltiples voces.

El canal de efectos permite aplicar cambios de tono, reverberación, retardo y compresión. Los usuarios pueden escuchar los resultados en vivo y guardar configuraciones como preajustes para perfiles de voz específicos.

La generación admite hasta 50.000 caracteres de una sola vez. Voicebox divide el texto en límites de oración, crea segmentos y los entrelaza para producir archivos largos, una característica útil para audiolibros, narraciones y capítulos extensos.

La aplicación también incorpora transcripción de audio con Whisper. El sistema puede extraer de forma automática el texto de referencia de una muestra de voz, con modelos que van desde Base, Small, Medium y Large hasta Turbo.

Whisper ofrece soporte para 99 idiomas en cada nivel disponible. Además, un modelo de lenguaje local puede limpiar muletillas, autocorrecciones y puntuación sin reformular el contenido, siempre como una función opcional que permanece en el dispositivo.

Modelos disponibles y voces con personalidad

La plataforma reúne motores de texto a voz con diferentes prioridades. Qwen3-TTS, de Alibaba, aparece en versiones de 1.7B y 0.6B, con clonación multilingüe, prosodia natural e instrucciones para controlar tono, ritmo y emoción.

Chatterbox, de Resemble AI, ofrece clonación zero-shot en 23 idiomas y control de exageración emocional. Chatterbox Turbo utiliza 350M de parámetros y admite etiquetas como [risa], [suspiro] e [inhala] dentro del texto.

LuxTTS, de ZipVoice, está orientado a la velocidad y al uso con CPU. El proyecto señala que puede superar 150 veces el tiempo real en CPU, funcionar a 48 kHz y utilizar cerca de 1 GB de VRAM.

Qwen CustomVoice, también de Alibaba, incluye nueve altavoces preestablecidos y control de estilo mediante instrucciones de lenguaje natural. TADA, de Hume AI, se ofrece en versiones de 3B y 1B, con una arquitectura diseñada para mantener más de 700 segundos de audio coherente.

Kokoro, de hexgrad y bajo licencia Apache 2.0, utiliza 82M de parámetros y busca operar en tiempo real con CPU y un consumo reducido de VRAM. Sus voces preconstruidas permiten generar habla sin realizar una clonación.

Para transcripción, Voicebox incluye Whisper de OpenAI en tamaños de 1.5B, 769M, 244M y 74M. También ofrece Whisper Turbo, de 809M, descrito como una versión podada de Whisper Large v3 con una velocidad aproximada de ocho veces mayor.

Qwen3, de Alibaba, funciona como modelo de lenguaje local en versiones de 4B, 1.7B y 0.6B. Puede limpiar transcripciones, producir respuestas con personalidad y apoyar el intercambio de voz entre los modelos de la plataforma.

El usuario puede asignar una personalidad de forma libre a cada perfil. Voicebox permite reescribir un texto manteniendo sus ideas, pero adaptando la entrega, o componer una línea nueva sin entrada adicional para crear diálogos de personajes.

El sitio muestra perfiles de demostración asociados con nombres como Jarvis, Samuel L. Jackson, Bob Ross, Sam Altman, Morgan Freeman, Linus Tech Tips, Fireship, Scarlett Johansson, Dario Amodei, David Attenborough, Zendaya y Barack Obama.

Estos perfiles funcionan como ejemplos de estilos vocales dentro de la demostración. La herramienta también presenta perfiles como Marlowe, creado desde una muestra de 12 segundos y definido como un detective de cine negro de los años cuarenta.

Integración con agentes, API y casos de uso

Voicebox incorpora una herramienta llamada voicebox.speak para que agentes compatibles con MCP puedan hablar con el usuario. La integración se realiza mediante un servidor local disponible en http://127.0.0.1:17493/mcp.

La configuración puede conectarse con Claude Code, Cursor, Cline o cualquier agente que utilice MCP. También existe un endpoint POST /speak para herramientas que no empleen ese protocolo, incluidos scripts de shell, sistemas ACP, arquitecturas A2A y desarrollos personalizados.

La API local expone funciones para generar habla, cancelar una generación, listar perfiles, crear nuevos perfiles, consultar el estado de los modelos, revisar el historial y verificar la salud del servidor.

Los endpoints principales incluyen POST /generate, POST /generate/{id}/cancel, GET /profiles, POST /profiles, GET /models/status, GET /history y GET /health.

La documentación OpenAPI queda disponible en /docs cuando Voicebox está activo. Un ejemplo de uso genera una línea de bienvenida con Qwen CustomVoice y permite añadir instrucciones como una entrega cálida, lenta y cinematográfica.

Los desarrolladores pueden integrar Voicebox en juegos para producir diálogos de personajes no jugables. También pueden localizar voces a nuevos idiomas o crear líneas expresivas sin montar un estudio de grabación tradicional.

En aplicaciones y agentes, la herramienta puede entregar narraciones en tiempo real, lecturas de accesibilidad y respuestas habladas. El procesamiento local busca dar al usuario control directo sobre sus datos de voz.

Para guionistas y creadores, el proyecto plantea generar capítulos de audiolibros por lotes, automatizar introducciones de pódcast o conectar el sistema con un Stream Deck. El requisito central consiste en acceder a una URL de localhost.

El dictado funciona mediante un atajo global. En macOS se mantienen las teclas Command y Option, mientras que en Windows se utiliza Control y Alt; al hablar, la transcripción llega al campo de texto activo o al portapapeles.

Descarga, comunidad y consideraciones de uso

Voicebox no requiere dependencias adicionales para su descarga. El proyecto ofrece versiones para Apple Silicon y procesadores Intel en macOS, un instalador MSI de 64 bits para Windows y una opción para compilar desde el código fuente en Linux.

El sitio también enlaza a una colección de tutoriales sobre configuración, clonación y producción. Entre los títulos presentados aparecen guías de Kevin Stratvert, Julian Goldie SEO, Dave Swift, Tech Guía, StinkyScrublet y mikbes.

Las demostraciones comunitarias describen una configuración sencilla y resultados favorables. Jimzip afirmó que clonar su propia voz fue fácil y que ahora puede escuchar recordatorios y tareas mediante una versión digital de su voz.

Otros usuarios, como Peiming Pai, señalaron que la herramienta supera a muchos servicios de pago. Theanoma.ly indicó que la utiliza en un proyecto de curso multimedia, mientras Kevin Serrano la emplea para aprender idiomas y crear materiales educativos.

DJWhy destacó que la curva de aprendizaje fue corta y agradeció que el programa fuera gratuito. Fitz describió una experiencia sin configuración, mientras creativeaction.ca resaltó su utilidad para quienes no se sienten cómodos hablando en público.

The Cowboy Movie Channel calificó la aplicación como un salvavidas. Mitja, por su parte, la describió como una herramienta de código abierto fantástica, comentarios que reflejan usos diversos fuera del entretenimiento profesional.

La clonación de voz también exige responsabilidad. Una muestra de pocos segundos puede producir un perfil convincente, por lo que los usuarios deben contar con autorización antes de copiar una voz ajena o utilizarla en contenidos públicos.

La presentación de Voicebox no incluye una discusión detallada sobre licencias de las voces demostrativas. Por eso, la disponibilidad técnica de la función no debe confundirse con permiso para imitar a personas reales o utilizar sus identidades.

Su enfoque local puede reducir la exposición de archivos de audio frente a servicios remotos. Sin embargo, la seguridad final dependerá del equipo, las aplicaciones conectadas y la forma en que cada usuario almacene sus perfiles y grabaciones.

Voicebox combina clonación, síntesis, transcripción, dictado y agentes en una sola aplicación. Su apuesta por el código abierto y la ejecución local podría atraer a creadores, desarrolladores y usuarios que buscan más control sobre la voz generada por inteligencia artificial.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín