Por Canuto  

Google presentó EmbeddingGemma 2, un modelo abierto de 740 millones de parámetros que, según la empresa, supera en pruebas de embeddings multimodales a competidores de hasta el doble de tamaño. También puede ejecutarse localmente en un navegador y está pensado para reducir la memoria y el almacenamiento necesarios en aplicaciones de búsqueda y RAG.
***

  • EmbeddingGemma 2 obtuvo 78,68 puntos en el Massive Text Embedding Benchmark (Code), frente a los 68,76 de su predecesor.
  • Google señala que el modelo funciona en el navegador con WebGPU, sin clave de API, y que cada consulta tarda entre 20 y 70 milisegundos.
  • La compañía ofrece una versión de 270 millones de parámetros para tareas solo de texto y plantea combinar el modelo con Gemma 4 para aplicaciones RAG sin conexión.

 


Un modelo pequeño con una promesa ambiciosa

Google presentó EmbeddingGemma 2, un modelo abierto diseñado para transformar texto, imágenes, video, audio y código en vectores numéricos. Esas representaciones permiten comparar contenidos y localizar elementos similares, una función útil para sistemas de búsqueda y otras aplicaciones que necesitan recuperar información relacionada. Según la información publicada por The Decoder el 6 de octubre de 2026, Google afirma que su modelo tiene 740 millones de parámetros y supera en pruebas a competidores de hasta el doble de tamaño.

La propuesta combina dos rasgos que suelen atraer a desarrolladores: un tamaño relativamente compacto y la capacidad de procesar distintos tipos de contenido. Google describe EmbeddingGemma 2 como el modelo más pequeño de su tipo, aunque esa calificación corresponde a la empresa y no a una comparación independiente detallada en la información disponible. La promesa central, por tanto, es que un modelo con menos parámetros puede ofrecer resultados competitivos en tareas de embeddings multimodales.

Un embedding es una representación numérica que ayuda a que un sistema compare elementos según su significado o sus características, en lugar de depender únicamente de coincidencias exactas de palabras. Cuando el contenido se expresa como vectores, una aplicación puede buscar materiales relacionados incluso si no comparten los mismos términos. EmbeddingGemma 2 extiende esa idea a texto, imágenes, video, audio y código, según Google, aunque la fuente no detalla resultados separados para cada modalidad.

La noticia también destaca un avance en una prueba concreta de código. EmbeddingGemma 2 logró 78,68 puntos en el Massive Text Embedding Benchmark (Code), frente a los 68,76 puntos de su predecesor, una diferencia cercana a diez puntos. Google sostiene que ese resultado lo coloca al nivel de modelos mucho más grandes, pero la cifra corresponde a ese benchmark y no debe interpretarse por sí sola como una evaluación de todas las tareas o usos posibles.

Ejecución local, velocidad y consumo de recursos

Una de las características prácticas señaladas por Google es que el modelo puede funcionar localmente, sin requerir una clave de API. La empresa indica que las consultas tardan entre 20 y 70 milisegundos cuando se ejecuta mediante WebGPU en el navegador. Esa posibilidad puede resultar relevante para quienes quieran probar una búsqueda basada en embeddings sin enviar cada consulta a un servicio remoto, aunque el rendimiento concreto también dependerá del equipo y del entorno de ejecución.

Google cifra en unos 191 MB la memoria RAM que necesita el modelo en ese escenario. La cifra apunta a una operación ligera en comparación con modelos de mayor tamaño, pero no equivale a un requisito universal para cualquier dispositivo o configuración. La información disponible no especifica en qué equipo se midió el consumo ni las condiciones exactas de la prueba, por lo que conviene leerla como un dato comunicado por la compañía y no como una garantía de rendimiento idéntico en todos los casos.

La empresa también afirma que EmbeddingGemma 2 puede reducir hasta seis veces el almacenamiento requerido por una base de datos vectorial local. Esa ventaja se relaciona con el espacio que ocupan las representaciones almacenadas, un factor que importa cuando una aplicación debe conservar y consultar muchos elementos en el propio dispositivo. El dato no significa que cualquier base vectorial vaya a ocupar exactamente una sexta parte: la reducción dependerá del caso de uso y de cómo se configure el sistema.

La ejecución en el navegador mediante WebGPU acerca el modelo a aplicaciones que no necesitan depender de una solicitud a una API para cada operación. En principio, esa arquitectura puede facilitar pruebas locales y reducir la necesidad de trasladar consultas a servidores externos. Sin embargo, la noticia no ofrece una evaluación comparativa de seguridad, privacidad o consumo energético, de modo que esos aspectos no pueden darse por resueltos solo porque el modelo pueda ejecutarse en el dispositivo.

Opciones para desarrolladores y aplicaciones RAG

Google también ofrece una versión de 270 millones de parámetros destinada a tareas que solo involucran texto. Esa alternativa permite elegir un modelo más pequeño cuando no se necesita procesar imágenes, video o audio, en lugar de usar la versión multimodal para todos los escenarios. La fuente no detalla diferencias de rendimiento entre ambas versiones, pero sí presenta la opción ligera como una variante enfocada en el trabajo textual.

La compañía plantea que EmbeddingGemma 2 puede combinarse con modelos abiertos pequeños como Gemma 4 para ejecutar aplicaciones RAG sin conexión. RAG, sigla de generación aumentada por recuperación, describe sistemas que buscan información relevante y la utilizan como contexto para responder consultas. En una implementación local, el modelo de embeddings ayuda a recuperar contenido relacionado, mientras que otro modelo puede elaborar una respuesta a partir de ese material.

El interés de esa combinación está en reunir búsqueda y generación de respuestas sin enviar datos a servidores externos, según la propuesta descrita por Google. Esto puede ser pertinente para proyectos que priorizan procesamiento local o que quieren experimentar con aplicaciones de recuperación de información sin depender de una clave de API. La fuente no asegura que toda aplicación RAG pueda funcionar sin conexión con cualquier equipo, por lo que las necesidades de hardware y la integración seguirán siendo decisiones del desarrollador.

Los pesos del modelo están disponibles en Hugging Face y Kaggle, y Google también ofrece una guía para desarrolladores y documentación. Ese acceso proporciona recursos para quienes quieran examinar el modelo e incorporarlo en proyectos, aunque la noticia no especifica condiciones de licencia ni pasos detallados de instalación. En conjunto, el lanzamiento presenta una alternativa abierta y local para embeddings multimodales, con resultados de benchmark y cifras de eficiencia que la compañía destaca, pero que cada implementación deberá poner a prueba en su propio contexto.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín