Lilith Lilith.
⌕
編集イラスト: Holo4は画面、code、APIを横断するが、benchmarkの条件はそろっていない
Lilithのイラスト · 編集リミックス

H CompanyはHolo4を2つの規模で公開した。dense modelの27Bと、Mixture of Experts方式の35B-A3Bだ。どちらもGUI、code、MCP、APIを扱い、課題に応じて接点を切り替える。weightはBF16、FP8、NVFP4、4-bit GGUFで公開され、H Models APIからも利用できる。

OSWorld 2.0では、H CompanyはHolo4 27Bに61.7%、Claude Opus 5.5に81.8%という値を示している。35B-A3Bは30.9%だった。公開benchmarkの結果に至るtrajectoryも公開され、最終scoreだけでなく各stepを確認できる。

1つのmodelがclick、shell、APIを使い分ける

Holo4の要点は画面操作だけではない。アプリをclickし、codeを書いて実行し、構造化されたtoolも呼び出せる。web画面、社内API、local fileをまたぐ企業のworkflowに近い設計だ。

同社によると、学習基盤はweb application、MCP server、desktop環境にまたがる約10,000件の課題を生成した。harnessも作り直し、数百stepにわたるmemoryと、操作対象のcomputer上で使えるshellを与えたという。

公開trajectoryは単独のscoreより検証に役立つ

開発者にとって、stepを再生できる価値は大きい。modelが安定して解いたのか、たまたま都合のよい経路を通ったのかを確認できる。また、model自体の能力と、harness、memory、周辺toolの寄与も切り分けやすい。

このreleaseの強みは、teamが失敗を調べ、自社環境に合わせられる点にある。長いagentic workflowでは、再現可能な実行を伴わないopen weightだけでは得られる情報が少ない。

cost比較には異なる実行条件と課題セットが混ざる

H Company自身が、benchmarkの版、harness、課題のsubsetが異なると明記している。AutomationBenchではHolo4を社内harnessで公開setに対して測り、一部の比較対象は非公開setの値を使う。cost推計も料金表やcacheの仮定が同一ではない。

数値に情報価値はある。ただし、cost performanceの主張は、同じcourseで行われた競争とはまだ言えない。

社外での再現が実務への移植性を示す

同じOSWorld 2.0の版、同じ課題、公開されたcostによる独立実行が重要になる。数百stepの間にUI、権限、状態が変わる社内applicationでの成功率も見逃せない。

公開trajectoryがcommunityによって近い結果で再現されれば、Holo4は複数の接点を扱うagentの有力な土台になる。社内harnessの外で性能が崩れるなら、modelより周辺のdataと手法の方が価値ある成果として残る。

Lilithの判定

Holo4は地図だけでなく、走行記録まで公開した。agent分野ではbenchmarkの新しいメダルより貴重だ。次は社外の運転手が、同社のnavigationなしで同じcourseを走り切れるかが問われる。

外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。

元の記事 ↗ ↗