Por Canuto  

H Company presentó Holo4, una familia de modelos de IA capaz de operar interfaces gráficas, escribir código y usar herramientas externas. Su versión 27B obtuvo 85,2% en OSWorld, aunque los derechos de autoalojamiento y las cifras de rendimiento varían entre modelos.
***

  • Holo4 27B registró 85,2% en OSWorld con un costo reportado de USD $0,08 por tarea.
  • La variante 35B-A3B es más rápida y económica, y H Company indica que sus pesos se publican bajo Apache 2.0.
  • La empresa presenta Holo4 como un agente que combina interfaces gráficas, código, MCP y APIs, con resultados dispares en pruebas de flujos largos.


H Company presenta Holo4, una familia de agentes con licencias y rendimientos distintos

H Company anunció Holo4, una serie de modelos agénticos diseñados para operar computadoras mediante pantallas, código y herramientas de software. La compañía afirma que la versión Holo4 27B obtuvo 85,2% en OSWorld y calcula un costo de USD $0,08 por tarea en ese benchmark, mientras que el acceso a los pesos descargables no implica los mismos derechos para todas las variantes.

La familia incluye un modelo denso de 27.000 millones de parámetros y otro de arquitectura Mixture of Experts con 35.000 millones de parámetros totales, de los cuales activa 3.000 millones. Según H Company, ambos están disponibles mediante su API, pero Superpower Daily destacó que la licencia de autoalojamiento distingue las posibilidades de uso comercial entre los pesos publicados.

Un agente para distintas interfaces

Holo4 busca realizar tareas digitales sin limitarse a una sola forma de interacción. El modelo puede hacer clic y escribir en una interfaz gráfica, ejecutar código propio y llamar herramientas a través del protocolo MCP o de APIs, de modo que una misma tarea puede combinar varios métodos cuando el flujo de trabajo lo requiere.

H Company sostiene que esa versatilidad responde a una limitación habitual de los agentes: los que dependen de interfaces gráficas necesitan ver la pantalla, mientras que los centrados en herramientas pueden quedar sin opciones ante una aplicación que no ofrece una API. La empresa dice que Holo4 funciona en computadoras de escritorio, la web, Android, entornos aislados de programación y APIs empresariales, con el mismo modelo y una forma común de invocarlo.

La compañía presenta los modelos como una opción para flujos empresariales reales, además de tareas de evaluación académica. Su anuncio señala que el entrenamiento combinó aprendizaje supervisado y aprendizaje por refuerzo con tareas y entornos, incluidos los producidos por su Agentic Task Factory, un sistema interno para construir pruebas interactivas y verificables.

Ese enfoque intenta que el agente resuelva pasos consecutivos en lugar de limitarse a una interacción aislada. H Company describe ejemplos que implican trabajar en programas profesionales y sostiene que el modelo puede alternar entre la pantalla, una terminal y llamadas a herramientas; sin embargo, los resultados publicados muestran que su desempeño no es uniforme entre las distintas clases de pruebas.

Resultados en benchmarks y costos por tarea

En OSWorld, una prueba de tareas de computadora, Holo4 27B obtuvo 85,2%, frente a 80,8% para Holo4 35B-A3B y 84,3% para Qwen3.8 27B en el cuadro de la empresa. H Company calcula costos respectivos de USD $0,08, USD $0,05 y USD $0,22 por tarea, por lo que el modelo más pequeño de Holo4 lidera entre esas tres opciones en precisión reportada y también registra un costo menor que el modelo de comparación.

La diferencia cambia en OSWorld 2.0, que mide flujos de trabajo más largos y presenta puntuación, tasa de éxito y costo. Holo4 27B registró 61,7% de puntuación, 41,5% de éxito y USD $1,22 por tarea, mientras que el 35B-A3B obtuvo 30,9%, 12,3% y USD $0,61; Qwen3.8 27B alcanzó 48,0%, 19,4% y USD $3,49, de acuerdo con las cifras recopiladas por H Company.

La publicación también compara Holo4 27B con modelos cerrados en esa prueba, pero advierte que algunos resultados proceden de reportes públicos y fueron obtenidos con distintos harnesses y niveles de esfuerzo. Por ejemplo, atribuye a Opus 5.5 una puntuación de 81,8%, un éxito de 48,7% y un costo de USD $8,48, cifras que la empresa presenta como referencia y no como una comparación ejecutada bajo un único protocolo común.

En AutomationBench, Holo4 27B alcanzó 45,4% con un costo calculado de USD $0,05 por tarea, y la variante 35B-A3B obtuvo 34,5% con USD $0,02. Qwen3.8 27B marcó 40,3% y USD $0,09 en la tabla, aunque H Company aclara que reporta el conjunto público de 600 tareas y que 480 se relacionan con la división de la que recopiló datos de entrenamiento.

Licencias, entrenamiento y límites de las comparaciones

Los derechos de descarga son una distinción central entre los dos modelos. H Company describe Holo4 35B-A3B como un modelo cuyos pesos abiertos se publican bajo Apache 2.0, mientras que Superpower Daily informó que los pesos descargables de la variante de escritorio más potente tienen restricciones de uso no comercial; por ello, la posibilidad de autoalojar un modelo no debe confundirse con una autorización general para explotarlo comercialmente.

La información disponible no presenta las condiciones de ambos modelos como idénticas y obliga a revisar la licencia concreta antes de integrarlos en un producto. La API alojada ofrece otra vía de acceso, con tarifas publicadas por H Company de USD $0,40 por millón de tokens de entrada para Holo4 27B y USD $3 por millón de tokens de salida; para el modelo 35B-A3B, los precios indicados son USD $0,30 por millón de tokens de entrada y USD $2 por millón de salida.

En cuanto al entrenamiento, la compañía dice que usó 127.000 millones de tokens para el ajuste fino supervisado. Cerca de tres cuartas partes correspondieron a trayectorias agénticas exitosas generadas en su Agentic Task Factory, con ejemplos de escritorio, web, MCP y API, además de una proporción menor de tareas móviles; el resto incluyó razonamiento multimodal, comprensión de interfaces y programación.

H Company afirma que su fábrica de tareas ha producido unas 10.000 pruebas: alrededor de 4.000 para aplicaciones web, 3.000 para servidores MCP y otras 3.000 para escritorio y sistemas operativos. La empresa explica que los agentes crean entornos y verificadores a partir de documentación, capturas de sitios web o software de código abierto, y que descarta tareas cuando no superan las validaciones definidas para comprobar tanto los resultados correctos como los errores cercanos al éxito.

Qué muestran las cifras para quienes evalúan Holo4

Los resultados móviles añaden otra diferencia entre las variantes: Holo4 27B obtuvo 85,1% en AndroidWorld, frente a 77,6% para el 35B-A3B y 81,9% para Qwen3.8 27B, según la tabla de la compañía. En las pruebas internas de Agentic Task Factory, el 27B también superó al 35B-A3B en web, MCP y escritorio, aunque esas puntuaciones corresponden a tareas construidas por H Company y no a un benchmark independiente.

La empresa publica además puntuaciones de tareas de terminal para ALE-CLI: 44,1% para Holo4 27B y 30,9% para la variante 35B-A3B. En esa prueba, H Company indica que excluyó intentos que alcanzaron respuestas de referencia presentes en la máquina de evaluación, dos de 105 ejecuciones para el 27B y una para el 35B-A3B, un detalle metodológico que influye en la lectura de los resultados reportados.

El anuncio incluye Holotron4 Nano, una actualización basada en Nemotron 3 Nano Omni que, según H Company, mejora en varias pruebas de interfaces gráficas, MCP y terminal. La compañía reporta, entre otros cambios, un avance de 21,0% a 76,3% en OSWorld y de 19,4% a 35,6% en AutomationBench; son resultados que la firma atribuye a su receta de posentrenamiento y que no deben confundirse con los puntajes de Holo4 27B o 35B-A3B.

Para las empresas y desarrolladores, la decisión dependerá de algo más que el mejor porcentaje de una tabla: también cuentan el tipo de flujo, el costo por ejecución, la velocidad y las condiciones de licencia. Holo4 27B encabeza varias de las cifras publicadas por su creador, mientras que el 35B-A3B reduce el costo en algunas pruebas y ofrece pesos bajo Apache 2.0; las comparaciones, no obstante, requieren cautela porque la propia H Company señala diferencias entre harnesses, conjuntos de tareas y métodos de evaluación.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín