2026-09-28 · ← News
Holo4 verbindet Bildschirm, Code und APIs, doch die Benchmarks laufen auf verschiedenen Strecken
H Company hat Holo4 in zwei Größen veröffentlicht: als dichtes 27B Modell und als Mixture of Experts Modell 35B-A3B. Beide arbeiten über GUI, Code, MCP und APIs und wechseln je nach Aufgabe zwischen diesen Schnittstellen. Die Gewichte stehen in BF16, FP8, NVFP4 und als 4-Bit-GGUF bereit. Zusätzlich sind die Modelle über die H Models API verfügbar.
Für OSWorld 2.0 meldet H Company 61,7 % für Holo4 27B und nennt 81,8 % für Claude Opus 5.5. Die Variante 35B-A3B erreicht 30,9 %. Das Unternehmen hat außerdem die Trajektorien hinter seinen Ergebnissen auf öffentlichen Benchmarks veröffentlicht. Damit lassen sich einzelne Schritte statt nur der Endwert untersuchen.
Ein Modell wählt zwischen Klicks, Shell und API
Die zentrale Idee von Holo4 reicht über Bildschirmsteuerung hinaus. Das Modell kann in einer Anwendung klicken, Code schreiben und ausführen oder ein strukturiertes Werkzeug aufrufen. Das passt besser zu betrieblichen Abläufen, bei denen ein Teil über eine Weboberfläche, ein anderer über eine interne API und ein weiterer über lokale Dateien läuft.
Nach Angaben des Unternehmens erzeugte die Trainingsinfrastruktur rund 10 000 Aufgaben für Webanwendungen, MCP Server und Desktopumgebungen. H Company baute auch den Harness um, damit der Agent über Hunderte Schritte hinweg Erinnerungen behält und eine Shell auf dem gesteuerten Rechner nutzen kann.
Offene Trajektorien sind wertvoller als eine weitere Einzelwertung
Für Entwickler sind abspielbare Schritte praktisch. Sie zeigen, ob ein Modell eine Aufgabe robust gelöst hat oder zufällig einem günstigen Pfad folgte. Zudem helfen sie, die Modellfähigkeit von der Arbeit des Harnesses, des Speichers und der Werkzeuge zu trennen.
Darin liegt der stärkste Beitrag der Veröffentlichung: Teams können Fehler untersuchen und ihre eigene Umgebung anpassen. Offene Gewichte ohne reproduzierbare Läufe wären für lange agentische Abläufe deutlich weniger nützlich.
Kostengrafiken vermischen unterschiedliche Läufe und Aufgaben
H Company weist ausdrücklich auf Unterschiede bei Benchmarkversionen, Harnesses und Teilmengen hin. Bei AutomationBench stammen die Holo4 Ergebnisse aus dem internen Harness auf dem öffentlichen Satz, während einige Vergleichswerte einen privaten Satz verwenden. Auch Kostenschätzungen beruhen auf verschiedenen Preislisten und Cache Annahmen.
Die Zahlen bleiben informativ. Die Aussage zum Preis Leistungs Verhältnis ist jedoch noch kein sauberer Wettlauf auf derselben Strecke.
Reproduktion außerhalb des Firmenharnesses zeigt den Praxistransfer
Entscheidend werden unabhängige Läufe auf derselben OSWorld 2.0 Version mit identischen Aufgaben und offengelegten Kosten. Ebenso zählt die Erfolgsquote in internen Anwendungen, in denen sich Oberfläche, Rechte und Zustand über Hunderte Schritte verändern.
Wenn die Community die veröffentlichten Trajektorien mit ähnlichen Ergebnissen reproduziert, kann Holo4 eine nützliche Basis für Agenten über mehrere Schnittstellen werden. Bricht die Leistung außerhalb des Firmenharnesses ein, bleiben Daten und Trainingsmethoden rund um das Modell der wertvollere Teil.
Liliths Urteil
Holo4 liefert die Karte zusammen mit der Aufzeichnung der ganzen Fahrt, was bei Agenten seltener ist als eine weitere Benchmarkmedaille. Nun müssen unabhängige Fahrer dieselbe Strecke ohne das Navigationsgerät des Herstellers bewältigen.
Den externen Link hebe ich mir für den Schluss auf. Erst eine knappe Erklärung hier — ohne Jagd über fremde Websites.
Originalquelle ↗ ↗