Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de voz que combinan conversación fluida, contexto visual, razonamiento complejo y ejecución de herramientas en segundo plano.
***
- Gemini 3.8 Live procesa imágenes casi en tiempo real, cambia entre 97 idiomas y mantiene conversaciones mientras ejecuta herramientas.
- Gemini 3.8 Live Extended Thinking está orientado a tareas complejas y puede razonar mientras habla, con narración de progreso para el usuario.
- Los modelos llegan a la Gemini API, Google AI Studio, Search Live, Gemini Live y servicios empresariales en distintas modalidades de acceso.
🚨 Google presenta Gemini 3.8 Live
IA de voz procesa imágenes casi en tiempo real, cambia entre 97 idiomas y ejecuta herramientas mientras conversa.
Extended Thinking razona tareas complejas y narra su progreso.
Despliegue inicial en API, AI Studio, Gemini Live y servicios… pic.twitter.com/NNnjUD5AXW
— Diario฿itcoin (@DiarioBitcoin) September 15, 2026
Google refuerza su apuesta por la voz
Google presentó Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, dos modelos de diálogo en vivo diseñados para hacer que las interacciones por voz sean más naturales, rápidas e inteligentes. La compañía los describe como modelos de conversación en tiempo real con mejoras enfocadas en razonamiento, contexto visual y ejecución de tareas complejas mediante comandos hablados.
La propuesta busca que el usuario no tenga que detener una conversación para esperar el resultado de una acción. Mientras una persona habla con el sistema, los modelos pueden procesar información visual, consultar herramientas, realizar llamadas a API y continuar el diálogo hasta completar el flujo solicitado. Esa arquitectura apunta tanto a asistentes de uso cotidiano como a agentes de voz para empresas y desarrolladores.
Gemini 3.8 Live está orientado a la escala y a la eficiencia de costos, con una combinación de conversación fluida, inteligencia contextual y capacidad para interpretar imágenes casi en tiempo real. Google también lo presenta como una alternativa para construir agentes de voz listos para producción, una categoría que compite por automatizar atención al cliente, incorporación de empleados y procesos internos.
La segunda variante, Gemini 3.8 Live Extended Thinking, está diseñada para escenarios que requieren razonamiento de múltiples pasos y mayor capacidad de resolución. Según la compañía, el modelo puede pensar y hablar de manera simultánea, utilizar señales verbales tempranas como “Déjame verificar eso…” y ofrecer una narración de progreso mientras termina tareas que se ejecutan en segundo plano.
Razonamiento, visión y conversación continua
Uno de los cambios centrales está en la posibilidad de mantener el flujo conversacional mientras el sistema trabaja con herramientas externas. En lugar de suspender el intercambio hasta que finalice una reserva, una consulta o una llamada a una función, Gemini puede reconocer la solicitud, informar avances y seguir respondiendo preguntas relacionadas durante el proceso.
Gemini 3.8 Live también incorpora entradas visuales casi en tiempo real para enriquecer sus respuestas con el contexto que observa. Google mostró usos como la incorporación de empleados, la explicación de situaciones visibles para el usuario y una partida de ajedrez en la que el modelo combina reconocimiento visual, razonamiento y conversación natural.
El modelo admite 97 idiomas y puede detectar y cambiar entre ellos a mitad de una conversación, una función que busca reducir la fricción en intercambios multilingües. La empresa plantea que esa capacidad resulta especialmente útil cuando una persona alterna idiomas durante una llamada o cuando un agente necesita atender a usuarios con diferentes preferencias lingüísticas.
Extended Thinking lleva ese enfoque a flujos más exigentes, como transformar bocetos y comentarios de voz en componentes funcionales de React, coordinar reservas con múltiples pasos o elaborar planes de negocio y kits de herramientas de marketing a partir de instrucciones habladas. En esos escenarios, la narración del progreso pretende evitar que el usuario interprete el silencio del sistema como una interrupción o un error.
Resultados reportados y aplicaciones empresariales
Google afirmó que Gemini 3.8 Live Extended Thinking obtuvo el primer lugar general en el Speech to Speech Quality Index de Artificial Analysis, con una puntuación de 82,6. La compañía también atribuyó al modelo un resultado de 68,6% en la finalización de tareas agénticas de τ-Voice y de 35,1% en el benchmark τ-Voice-banking de Sierra.
En razonamiento de audio, el modelo alcanzó 97,7% en Big Bench Audio, de acuerdo con las cifras divulgadas por Google. La empresa destacó además que mantiene un precio competitivo frente a otros modelos de frontera, aunque la publicación no detalló en el anuncio la estructura completa de costos para cada modalidad de uso.
Gemini 3.8 Live, por su parte, apareció en el segundo lugar del Speech Agent Arena según la compañía, que también lo describió como un modelo rentable para desarrolladores y empresas. En EVA-Bench de ServiceNow, una evaluación de agentes de voz, Google aseguró que ambas variantes amplían la frontera de eficiencia al equilibrar precisión y calidad conversacional en flujos de trabajo complejos.
Los resultados corresponden a afirmaciones de la propia empresa y, en el caso de EVA-Bench, Google indicó que la prueba se ejecutó mediante Live API en Gemini Enterprise Agent Platform. Artificial Analysis explica que su índice de voz a voz combina evaluaciones de razonamiento del habla y tareas agénticas, por lo que las puntuaciones dependen de la metodología y del entorno de prueba. El rendimiento de un agente de voz también puede variar según la infraestructura, las herramientas conectadas, la latencia de red y la forma en que se construye cada flujo de trabajo.
Disponibilidad para usuarios y desarrolladores
Gemini 3.8 Live comenzó a desplegarse en la Gemini API y Google AI Studio para desarrolladores, mientras que las empresas pueden acceder a una vista previa privada en Gemini Enterprise. Google indicó que el modelo llegará posteriormente a Gemini Enterprise for Customer Experience y que también estará disponible para todos los usuarios en Search Live.
La variante Gemini 3.8 Live Extended Thinking inició su despliegue en la Gemini API y Google AI Studio, con una vista previa privada para clientes empresariales de Gemini Enterprise. La compañía también señaló que llegará a Gemini Enterprise for Customer Experience y a clientes empresariales de Google Workspace en una etapa posterior.
Para el público general, Extended Thinking comenzó a incorporarse en Gemini Live, además de estar disponible para suscriptores de Google AI Pro y Ultra en Workspace dentro de Docs. Google añadió que todos los suscriptores de Google AI podrán utilizar las funciones correspondientes en Gmail y Keep, con una disponibilidad que puede depender del producto y del plan contratado.
El anuncio también mencionó a Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel y Vision Agents como plataformas que utilizan la Gemini Live API para facilitar la construcción de interfaces de voz. Esas herramientas gestionan parte de la infraestructura de transmisión de medios en tiempo real, permitiendo que los equipos de desarrollo concentren más esfuerzos en la experiencia del usuario y menos en la operación técnica de los flujos de audio.
Seguridad, alianzas y próximos usos
Google afirmó que empresas como Salesforce, Genspark y Lumeris muestran interés en Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking, especialmente por su latencia, fluidez y capacidad para llamar herramientas. Estas alianzas apuntan a un escenario en el que los agentes de voz no solo responden preguntas, sino que también coordinan operaciones conectadas con sistemas empresariales.
La automatización de tareas mediante voz puede reducir pasos para el usuario, pero también eleva la importancia de los permisos y la supervisión. Cuando un modelo puede reservar, consultar servicios, modificar documentos o activar funciones mientras conversa, las empresas deben definir con precisión qué acciones requieren confirmación y cuáles pueden ejecutarse de forma autónoma.
En materia de transparencia, SynthID es la tecnología de Google DeepMind destinada a incorporar marcas de agua e identificar contenido generado por inteligencia artificial. La documentación pública describe la marca como imperceptible para las personas y orientada a facilitar la identificación del contenido sintético. La disponibilidad y el alcance de estas funciones pueden variar según el producto y la modalidad de generación, por lo que no debe interpretarse como una garantía de detección universal de cualquier audio creado con IA.
La compañía remitió a la model card de estos sistemas para consultar detalles sobre seguridad y responsabilidad. Con la llegada de estos modelos a Search, Workspace, Gemini Live y plataformas para desarrolladores, la competencia por crear asistentes de voz más capaces entra en una fase donde la calidad de la conversación deberá medirse junto con la precisión, el control de herramientas y la identificación del contenido generado.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Hardware
Ubuntu 26.10 busca acelerar las portátiles Intel Core 3 Wildcat Lake
Noticias
Fedora 45 Beta llega con KMSCON, GNOME 51 y nuevas medidas de seguridad
IA
Daniel Kokotajlo identifica a Dan Selsam como investigador de capacidades de OpenAI
Estados Unidos

