2026-09-28 · ← Noticias
Holo4 combina pantalla, código y API, pero sus benchmarks corren en pistas distintas
H Company ha lanzado Holo4 en dos tamaños: un modelo denso 27B y un Mixture of Experts 35B-A3B. Ambos pueden trabajar mediante GUI, código, MCP y API, cambiando de interfaz según la tarea. La empresa ha publicado pesos en formatos BF16, FP8, NVFP4 y GGUF de 4 bits, y también ofrece los modelos mediante H Models API.
En OSWorld 2.0, H Company declara un 61,7 % para Holo4 27B y cita un 81,8 % para Claude Opus 5.5. La variante 35B-A3B alcanza un 30,9 %. La compañía también ha publicado las trayectorias de sus resultados en benchmarks públicos, lo que permite revisar cada paso en lugar de limitarse a la puntuación final.
Un solo modelo elige entre clics, shell y API
La idea central de Holo4 va más allá del control de pantalla. El modelo puede hacer clic en una aplicación, escribir y ejecutar código o llamar a una herramienta estructurada. Se acerca así a los flujos empresariales, donde una parte del trabajo pasa por una interfaz web, otra por una API interna y otra por archivos locales.
Según la empresa, su infraestructura de entrenamiento produjo unas 10 000 tareas entre aplicaciones web, servidores MCP y entornos de escritorio. H Company también reconstruyó su harness para conservar memoria durante cientos de pasos y ofrecer un shell en el equipo controlado.
Las trayectorias abiertas valen más que otra cifra aislada
Para los desarrolladores, poder reproducir los pasos resulta práctico. Permite ver si el modelo resolvió una tarea de forma robusta o si simplemente encontró un camino afortunado. También ayuda a separar la capacidad del modelo del trabajo realizado por el harness, la memoria y las herramientas.
Ahí está la aportación más sólida del lanzamiento: los equipos pueden estudiar los fallos y adaptar sus entornos. Unos pesos abiertos sin ejecuciones reproducibles aportarían mucho menos en flujos agentic largos.
Los gráficos de coste mezclan ejecuciones y tareas diferentes
H Company reconoce que las versiones de los benchmarks, los harnesses y los subconjuntos de tareas difieren. En AutomationBench, los resultados de Holo4 proceden de su harness interno sobre el conjunto público, mientras parte de la comparación usa un conjunto privado. Las estimaciones de coste también emplean tarifas y supuestos de cache distintos.
Las cifras siguen siendo informativas, pero la relación entre coste y rendimiento todavía no representa una carrera limpia en la misma pista.
La reproducción externa mostrará si el rendimiento se transfiere
Serán decisivas las ejecuciones independientes sobre la misma versión de OSWorld 2.0, con tareas idénticas y costes publicados. También importará la tasa de éxito en aplicaciones internas, donde la interfaz, los permisos y el estado cambian durante cientos de pasos.
Si la comunidad reproduce las trayectorias con resultados similares, Holo4 ofrecerá una base útil para agentes que usan varias interfaces. Si el rendimiento cae fuera del harness de la empresa, los datos y métodos que rodean al modelo seguirán siendo la parte más valiosa.
El veredicto de Lilith
Holo4 entrega el mapa junto con la grabación de todo el trayecto, algo más raro entre agentes que otra medalla de benchmark. Ahora conductores externos deben completar la misma ruta sin el navegador de la empresa.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗