Por Canuto  

Liquid AI publicó Pipette, una suite de código abierto que evalúa modelos de inteligencia artificial directamente en dispositivos edge al combinar modelo, cuantización, runtime y hardware en una sola medición.
***

  • Pipette analiza más de 1.000 configuraciones con más de 30 modelos y cinco métricas de rendimiento on-device.
  • La plataforma muestra que modelos con tamaños similares pueden perder rendimiento de manera muy distinta al aumentar el contexto.
  • Las puntuaciones de calidad se calculan en sistemas NVIDIA H100 y se emparejan con las mediciones obtenidas en teléfonos y computadoras.


Liquid AI publicó Pipette como una suite de código abierto para medir cómo funcionan los modelos fundacionales cuando abandonan los servidores y se ejecutan en dispositivos edge. La iniciativa busca resolver una limitación habitual de las fichas técnicas, cuyos resultados suelen reflejar condiciones de servidor y precisión completa, pero no necesariamente el comportamiento de un teléfono, una tableta o una computadora personal. En colaboración con Artificial Analysis, que revisó y validó de forma independiente la metodología, la empresa plantea que el rendimiento on-device pertenece al sistema desplegado y no al modelo considerado de manera aislada.

La unidad central de Pipette combina cuatro elementos: modelo, cuantización, runtime y dispositivo. Esa perspectiva permite observar cómo una misma arquitectura cambia al utilizar distintos formatos de precisión, compilaciones de software, sistemas operativos o componentes físicos, una diferencia relevante para desarrolladores que deben equilibrar velocidad, memoria, privacidad y conectividad antes de llevar una función de IA al mercado.

Una medición más cercana al uso real

El conjunto de datos inicial reúne cinco métricas de rendimiento on-device en más de 1.000 configuraciones de modelo, cuantización, runtime, dispositivo y contexto. La cobertura incluye más de 30 modelos, varios formatos de cuantización, compilaciones de llama.cpp para macOS, iOS, Windows y Android, además de longitudes de contexto que van desde 256 hasta 8.192 tokens.

Los primeros resultados verificados proceden de un MacBook Pro con M5 Max, un iPhone 17 Pro y un Galaxy S26 Ultra. Liquid AI también anunció que próximamente incorporará mediciones del AMD Ryzen AI Max+ 395 junto con la Radeon 8060S, aunque esos resultados todavía no forman parte del conjunto inicial presentado.

En este marco, un benchmark define la métrica y la forma de los tokens, y después produce un resultado de latencia, throughput o memoria. La calidad se sigue por separado mediante IFBench, GPQA Diamond y MATH-500, de modo que el lector puede observar el intercambio entre precisión de respuesta y desempeño físico sin confundir ambos tipos de medición.

La plataforma se distribuye bajo la licencia Apache 2.0 mediante tres componentes, llamados pipette-mgmt, pipette-clients y pipette-scores. También incluye un conjunto de datos público, un dashboard alojado y aplicaciones nativas para realizar pruebas en iOS y Android, sin lista de espera para quienes quieran consultar o ejecutar la infraestructura disponible.

El contexto puede cambiar el resultado

Una de las comparaciones publicadas muestra que dos modelos con 350 millones de parámetros pueden reaccionar de forma muy distinta al aumentar el contexto. En formato Q4_K_M y sobre el Galaxy S26 Ultra, Granite-4.0-H-350M conservó el 78,4% de su throughput de decodificación entre 256 y 4.096 tokens de entrada, mientras Granite-4.0-350M retuvo apenas el 33,8%.

El contraste sugiere que el conteo de parámetros no basta para anticipar una experiencia móvil consistente. La forma en que cada modelo administra la atención, la memoria y el procesamiento del contexto puede modificar el rendimiento de una tarea, incluso cuando el tamaño nominal y la cuantización parecen comparables.

Pipette también observó una ventaja de velocidad en modelos con activación dispersa, aunque esa característica no elimina las exigencias de memoria. Con 2.048 tokens de entrada en el Galaxy S26 Ultra, LFM2.5-8B-A1B decodificó 2,4 veces más rápido que Qwen3.5-4B y 2,6 veces más rápido que Ministral-3-3B-Instruct-2512.

El modelo activa 1,5 mil millones de parámetros de un total de 8,5 mil millones por token, según los datos publicados, pero todos los pesos de sus expertos deben ocupar memoria. Por esa razón alcanzó un pico de 5,29 GiB, una cifra que recuerda que mayor velocidad de cálculo no equivale automáticamente a menor consumo de memoria durante el despliegue.

Velocidad, calidad y decisiones de hardware

La relación entre rapidez y calidad tampoco resultó lineal en las pruebas de Pipette. En un iPhone 17 Pro, con cuantización Q4_K_M y una carga de trabajo de 2.048 tokens de entrada y 256 de salida, MiniCPM5-1B terminó en 3,47 segundos, frente a los 4,12 segundos de LFM2.5-1.2B-Instruct.

La diferencia representa una reducción del 15,8% en el tiempo total para MiniCPM5-1B, pero LFM obtuvo una ventaja de 9,0 puntos en MATH-500 sobre los mismos artefactos. El resultado ilustra una decisión habitual para los equipos de producto: el modelo más veloz puede no ser el más conveniente si la tarea exige mayor capacidad de razonamiento o precisión matemática.

Otra comparación, realizada en un M5 Max con Q4_K_M y 2.048 tokens de entrada, encontró perfiles de sistema casi idénticos entre Granite-4.1-8B y Ministral-3-8B-Instruct-2512. Ambos modelos solo se diferenciaron en 2,4% de throughput de decodificación y en 1,2% de RAM máxima, pero sus resultados de calidad tomaron caminos opuestos.

Granite lideró IFBench por 7,3 puntos, mientras Ministral obtuvo una ventaja de 14,0 puntos en GPQA Diamond. Para una empresa, esa divergencia puede afectar la selección del modelo según el tipo de tarea, incluso cuando las diferencias de memoria y velocidad parecen demasiado pequeñas para justificar una decisión por sí solas.

Una infraestructura para equipos y fabricantes

La propuesta está dirigida a cualquier organización que deba desplegar modelos en hardware que no controla por completo. Desarrolladores individuales y startups pueden utilizar el dashboard y las aplicaciones sin construir una infraestructura propia, mientras los equipos de producto de empresas medianas pueden ejecutar los clientes sobre una flota interna de dispositivos.

Los fabricantes de teléfonos, chips y otros equipos también pueden operar el pipeline detrás de sus propios firewalls. Entre los usos previstos figuran la selección de modelos y cuantizaciones antes de comprometer un sprint, la validación de adquisiciones de sistemas en chip y las pruebas de regresión después de actualizar un runtime, un sistema operativo o un controlador.

La herramienta puede resultar especialmente útil en electrónica de consumo, automoción, robótica, industria, dispositivos de salud, servicios financieros y defensa. En esos sectores, la inferencia local puede responder a necesidades de latencia, privacidad o conectividad, pero cada ventaja depende de que el modelo funcione de manera estable en el dispositivo concreto donde se ejecutará.

Además, Pipette permite planificar la capacidad necesaria para diferentes longitudes de contexto y contrastar de forma independiente las afirmaciones de rendimiento de los proveedores. La publicación de resultados enviados por la comunidad todavía se encuentra en beta, por lo que la utilidad del repositorio dependerá también de la consistencia con que los participantes documenten sus configuraciones y mantengan comparables las mediciones.

Cómo se validan las pruebas

La metodología establece formas de token fijas, decodificación greedy, una repetición de calentamiento que se descarta y cinco repeticiones medidas. Antes de cada ejecución cronometrada, una comprobación específica de la plataforma revisa las condiciones térmicas y la carga del sistema, y las pruebas que no cumplen los requisitos de preparación no se publican.

Las evaluaciones de calidad siguen un protocolo separado, con puntuación determinista y a ciegas respecto del modelo. El componente pipette-scores no conoce la procedencia de la generación, una separación que pretende reducir el riesgo de que la identidad del modelo influya en la evaluación de sus respuestas.

Cada envío registra la versión del benchmark, la forma de los tokens, el artefacto utilizado, la cuantización, la versión y configuración del runtime, además del hardware y el sistema operativo. Esa trazabilidad es importante porque una modificación aparentemente menor en la compilación o en el controlador puede alterar el resultado final sin que cambie el modelo original.

Las puntuaciones de calidad que acompañan a los resultados on-device se obtienen actualmente mediante ejecuciones de llama.cpp en sistemas de referencia NVIDIA H100 de 80 GB. Por tanto, una puntuación de calidad presentada junto al throughput de un teléfono no fue producida en ese teléfono, sino emparejada con la ejecución móvil cuando ambas utilizan el mismo modelo y la misma cuantización.

El desafío de comparar sistemas completos

El enfoque de Pipette desplaza la conversación desde las cifras abstractas del modelo hacia la experiencia concreta del usuario. Para una aplicación que responde sin conexión, por ejemplo, el tiempo hasta la primera respuesta, el consumo de RAM y el comportamiento con conversaciones largas pueden importar tanto como la calidad promedio registrada en un servidor.

La cuantización ocupa un lugar central en ese análisis porque reduce el tamaño de los pesos y puede acelerar la inferencia, aunque también puede introducir compromisos de calidad. El runtime y el hardware agregan otra capa de variabilidad, ya que una misma representación puede beneficiarse de una implementación específica o perder rendimiento cuando cambia la plataforma.

Artificial Analysis revisó y verificó la metodología como entidad independiente, pero los resultados siguen describiendo las configuraciones y dispositivos incluidos en la publicación. No constituyen una garantía universal para todos los teléfonos, computadoras o sistemas operativos, una cautela necesaria cuando los equipos usan estos datos para tomar decisiones de compra o diseño.

La principal aportación de la suite consiste en hacer visible esa complejidad mediante registros reproducibles y comparaciones concretas. En lugar de preguntar cuál es el modelo más rápido en términos generales, los usuarios pueden preguntar qué combinación ofrece el balance adecuado entre rendimiento, memoria y calidad para una tarea, un contexto y un dispositivo determinados.

El lanzamiento de Pipette llega en un momento en que la industria intenta trasladar más funciones de IA desde la nube hacia teléfonos, computadoras y máquinas especializadas. Si la participación comunitaria amplía la cobertura y conserva el rigor de los controles, la plataforma podría convertirse en una referencia para detectar diferencias que las fichas de modelos no muestran.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín