Por Canuto  

Google presentó Gemini 3.5 Transcribe, un modelo que busca convertir la voz en texto con mayor rapidez y producir una versión más limpia del discurso. La herramienta puede eliminar muletillas y procesar correcciones, aunque su disponibilidad inicial se concentra en determinados productos y herramientas para desarrolladores.
***

  • Según Google, Gemini 3.5 Transcribe procesa el texto final aproximadamente 70% más rápido que Chirp 3.
  • El modelo elimina muletillas, procesa correcciones y admite vocabulario personalizado; detecta y transcribe más de 85 idiomas.
  • Google lo incorporó a productos y herramientas como Gboard, Gemini para macOS, Antigravity, AI Studio y la API de Gemini, mientras prepara su llegada a Chrome.


Google presentó Gemini 3.5 Transcribe, un modelo de inteligencia artificial enfocado en convertir voz en texto y entregar una versión más limpia del discurso. A diferencia de un sistema que se limita a copiar cada palabra, la herramienta intenta eliminar muletillas, corregir tropiezos y entender las rectificaciones que una persona hace mientras habla. Esta apuesta puede acelerar la escritura dictada, pero también modificar la redacción original.

La compañía afirma que Gemini 3.5 Transcribe procesa aproximadamente 70% más rápido el trayecto entre la voz del usuario y el texto final frente a su anterior motor de reconocimiento, Chirp 3. La comparación procede de las mediciones divulgadas por Google y no implica que cada transcripción alcance esa mejora en todas las condiciones de uso.

Una transcripción que intenta interpretar

Gemini 3.5 Transcribe no solo busca identificar las palabras pronunciadas, sino también producir un texto más elaborado. Durante el dictado puede retirar expresiones como “eh” y “em”, además de procesar las correcciones que una persona realiza mientras habla.

El modelo también permite incorporar un vocabulario personalizado para reconocer jerga especializada, nombres propios o expresiones poco comunes. Google señala que detecta y transcribe más de 85 idiomas, con capacidad para manejar acentos regionales y distintos dialectos. En audio pregrabado, puede atribuir intervenciones a los hablantes e incluir marcas de tiempo a nivel de palabra.

La ventaja práctica es evidente en mensajes, notas y fragmentos breves, donde corregir errores después de dictar suele consumir más tiempo que escribir manualmente. Sin embargo, la limpieza automática introduce una diferencia importante: el resultado puede no ser una transcripción literal, porque la inteligencia artificial modifica la forma en que fueron dichas algunas ideas.

Esa distinción importa especialmente en entrevistas, reuniones, declaraciones públicas o cualquier situación en la que el registro exacto de las palabras tenga valor. Las pruebas citadas sobre Rambler, la función de entrada de voz de Gboard que utiliza Gemini en Pixel 11, apuntan a que la herramienta puede ordenar inconsistencias y tropiezos verbales, pero el usuario aún debe revisar el texto cuando la precisión documental sea prioritaria.

Primeras integraciones de Google

Gemini 3.5 Transcribe comenzó a aparecer en productos concretos del ecosistema de Google, aunque su disponibilidad inicial sigue siendo limitada. Rambler está incorporado en Gboard para teléfonos Pixel 11, y la empresa planea extender esa función a más dispositivos con Gemini Intelligence durante el resto del año.

La aplicación Gemini para macOS también empezó a beneficiarse del nuevo modelo, según la información difundida por Google. En ese caso, los usuarios pueden utilizar la entrada de voz con una capacidad que pretende entregar texto depurado en lugar de reproducir cada pausa, repetición o corrección del discurso original.

La expansión no se restringe a las aplicaciones destinadas al público general. Antigravity recibió acceso al modelo, incluido el contexto de pantalla y el historial de chat, siempre que el usuario conceda el permiso correspondiente, lo que permite a la herramienta interpretar mejor la tarea que acompaña una orden de voz.

AI Studio también incorporó Gemini 3.5 Transcribe para que los desarrolladores creen aplicaciones con conversión de voz a texto optimizada mediante inteligencia artificial. Además, el modelo está disponible a través de la API de Gemini, una vía que podría llevar sus funciones de edición y reconocimiento a productos que no pertenecen directamente a Google.

La llegada pendiente a Chrome

Quienes no tengan acceso a esos dispositivos o aplicaciones todavía no necesariamente encontrarán Gemini 3.5 Transcribe en sus herramientas habituales. Google indicó que prepara la llegada de la transcripción con IA al navegador Chrome “pronto”, aunque no proporcionó una fecha concreta para ese despliegue.

La integración prevista permitiría introducir texto mediante la voz en cualquier campo web, en lugar de limitar el dictado a una aplicación específica. Eso abarcaría desde correos electrónicos y comentarios hasta instrucciones dirigidas a otros chatbots de inteligencia artificial, con la promesa de una experiencia más uniforme entre servicios.

El alcance de esa función dependerá tanto de la precisión del reconocimiento como de la forma en que el modelo decida editar el contenido. Una herramienta que elimina una muletilla puede ahorrar tiempo, pero una que interpreta de manera incorrecta una corrección o un término especializado puede producir un mensaje distinto al que el usuario pretendía enviar.

Por esa razón, la velocidad anunciada no elimina la necesidad de supervisión humana, sobre todo cuando el texto dictado tiene consecuencias legales, profesionales o financieras. Google presenta Gemini 3.5 Transcribe como una mejora de productividad, mientras que su adopción más amplia pondrá a prueba cuánto control desean conservar los usuarios sobre la diferencia entre hablar, transcribir y reescribir.

Velocidad frente a fidelidad

El contraste con Chirp 3 muestra que Google está midiendo el tiempo hasta obtener el resultado y la precisión del reconocimiento. La mejora de velocidad comunicada por la compañía puede beneficiar el uso cotidiano, aunque no garantiza que cada nombre, cifra o palabra técnica sea interpretado correctamente.

La tasa de error tampoco captura por completo los cambios editoriales que el modelo realiza para producir un texto pulido. Un sistema puede reconocer correctamente una frase y, aun así, reformularla para retirar una repetición o resolver una corrección. Por ello, la evaluación debe considerar tanto la exactitud verbal como la fidelidad al sentido.

El diseño parece especialmente orientado a conversaciones y dictados informales, donde las pausas y rectificaciones forman parte natural del habla. Para usuarios que redactan mensajes rápidamente, esa intervención puede sentirse como una ayuda; para quienes necesitan conservar el testimonio exacto de una persona, la misma función podría convertirse en una fuente de confusión.

Google no anunció en la información disponible un calendario completo para todos los productos ni detalló las condiciones específicas de acceso de cada integración. Por ahora, Gemini 3.5 Transcribe avanza desde Pixel 11, Gemini para macOS y herramientas para desarrolladores hacia una eventual presencia más amplia, con Chrome como uno de los próximos escenarios de prueba.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.nnEste artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín