この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • Holo4は27B denseと35B-A3B MoEの2サイズ。GUI・コード・MCP・APIを同一モデルで操作する
  • OSWorld 2.0でHolo4 27Bは61.7%。Opus 5.5の81.8%に劣るが、低コストで競合すると主張する
  • 重みはHugging FaceでBF16・FP8・NVFP4・4bit GGUFとして公開。H Models APIでも提供

発表された内容

H Companyは、ソフトウェアを操作する汎用エージェント向けの新しいモデルシリーズ「Holo4」を公開した。サイズは27Bのdenseモデルと、35B-A3BのMixture of Experts(MoE)の2種類で、いずれも同社のH Models APIから利用できる。あわせて、既存のHolotron 3を更新したHolotron4 Nanoも公開された。モデルの重みや実行の軌跡(trajectory)もHugging Faceで公開されている。

Holo4は前世代モデルを土台に、利用可能なあらゆるインターフェースを通じてソフトウェアとやり取りする。学術ベンチマークでも一定の成績を残しているが、同社は実際の業務ワークフロー向けに設計したと説明する。学習には教師あり学習と強化学習を用い、Agentic Task Factoryが生成したものを含む多数の環境とタスクで訓練したという。

1つのモデルで複数の操作方式

Holo4は、画面上のクリックや文字入力をはじめ、コードを書いて実行する、MCPやAPIのツールを呼び出す、といった操作をタスクに応じて使い分ける。多くのエージェントモデルは単一のインターフェース専用に訓練されており、画面を持たないGUI特化モデルや、APIを持たないアプリケーションの前で立ち往生するツール呼び出し型モデルがあると同社は指摘する。実際の業務はそのように分かれていないため、1つのタスクで複数の方式を組み合わせる必要が生じる。

動作環境はデスクトップ、Web、Android、コードサンドボックス、業務APIに及ぶが、いずれも同一モデル・同一の呼び出し方で使えるとしている。記事ではQwenベースモデルからの改善を示す例として、FreeCADでの3Dモデリングや、GodotでのPac-Man風ゲームの構築が挙げられている。

ベンチマークとコスト

デスクトップ操作のベンチマークOSWorld 2.0で、Holo4 27Bは61.7%を記録した。原文ではOpus 5.5の81.8%と比較され、Holo4 35B-A3Bは30.9%とされている。同社は、長いワークフローでは最強のクローズドモデルに及ばないものの、桁違いに少ないパラメータと大幅に低いコストで動作すると説明する。

ただし、スコアの比較条件は一様ではない。原文には、リリース時期やハーネス、タスクのサブセットが異なること、Opus 5(70.2%)とGPT-5.6 Sol(66.2%)が別の評価設定の数値であることが注記されている。コストも各エージェント実行の入出力トークンから推定した値だとされている。

学習の仕組みと派生モデル

学習データの一部は、同社のAgentic Task Factoryが生成した。これは実際のサイトのスクリーンショットやオープンソースソフトウェアのドキュメントだけから、対話的な環境と検証可能なタスクを組み立てる仕組みで、これまでにWebアプリ、MCPサーバー、デスクトップ環境にまたがる約10,000のタスクを生み出したという。同じ状態をGUIとMCPの両方から見せるハイブリッド環境も含まれる。

同社はモデルの行動を実行し、数百ステップにわたって文脈を管理するハーネスも作り直した。最大の変更点は、数百ステップを追跡できる信頼性の高いメモリと、デスクトップマシン上のシェルを与えたことだと説明されている。Holotron4 Nanoは、NVIDIA Nemotron Coalitionの一員としてNemotron 3 Nano Omniに同じ学習スタックを適用したもので、レシピはモデルサイズに依存しないとしている。

現時点での注意点

公開された数値には比較条件の違いが含まれるため、他モデルとの単純な優劣として読むのは適切ではない。AutomationBenchについては社内ハーネスで測定した値で、同社はプライベートセットでのHolo4の評価が済み次第報告するとしている。API利用時の具体的な料金も原文には示されていない。

推論をさらに高速化するDSpark drafterのチェックポイントは、今後数日中に公開予定とされている。対応言語や日本語の業務システムでの実用性については、原文に記載がない。

デスクトップ操作ベンチマークOSWorld 2.0のスコア比較
モデルOSWorld 2.0スコア
Holo4 27B61.7%
Holo4 35B-A3B30.9%
Opus 5.581.8%
原文からの引用
Most agentic models are trained for one interface only: GUI-focused models are blind without a screen, while models that prefer tool calling are stuck in front of an application that has no API.

ほとんどのエージェントモデルは1つのインターフェース専用に訓練されている。GUIに焦点を当てたモデルは画面がなければ見えず、ツール呼び出しを好むモデルはAPIを持たないアプリケーションの前で立ち往生する。

今後の見通し

次に注目されるのは、推論を高速化するDSpark drafterのチェックポイント公開と、AutomationBenchのプライベートセットでのHolo4の評価結果だとみられる。ベンチマークの数値はリリース時期やハーネス、タスクのサブセットが異なると注記されているため、同条件での比較が示されて初めて性能差を正確に判断できる。また、Holotron4 Nanoで示されたように学習スタックが他の基盤モデルへ移植できるなら、Nemotron 3 Nano Omni以外のモデルへの展開が進むかどうかが、同社のレシピの汎用性を測る材料になる。API料金の具体額が公表されれば、コスト優位という主張を自社のワークロードで検証できる。

日本の開発者・IT企業にとっての意味

日本のIT企業にとって重要なのは、GUIしか持たないレガシーな社内システムと、APIやMCPを持つ比較的新しいシステムが混在する現場で、同じモデルを使い回せる点である。インターフェースごとにモデルを選び直す手間が減れば、RPAのように画面操作だけに依存しない自動化を検討しやすくなる。また、重みがBF16やFP8、4bit GGUFなど複数形式で公開されるため、クラウドAPIだけでなく自社サーバーでの推論も選択肢に入る。一方で、公開されているスコアはハーネスやタスクセットが異なるため、そのまま自社業務の精度を保証するものではない。PoCでは自社の画面・API・コード実行の混在タスクで検証し、トークン消費とコストを実測して判断するのが現実的だ。

気になる点

Holo4の利用料金はいくらですか
H Models APIで提供され、コストはH Models APIのレートに基づくとされているが、具体的な金額は原文に記載がない。自前で動かす場合は、Hugging FaceでBF16、FP8、NVFP4、4bit GGUFの重みが公開されているため、自社インフラでの推論も選択肢になる。料金は公開情報の確認が必要だ。
既存のエージェント実装から乗り換えられますか
27B denseと35B-A3B MoEの2サイズがあり、呼び出し方はプラットフォームによらず同一だと説明されている。API経由でも重みを使った自前推論でも利用できるため、移行のハードルは比較的低いとみられる。ただし個別のインターフェース対応の詳細は原文では示されていない。
日本語の業務システムでも使えますか
原文には対応言語や日本語環境に関する記載がない。Holo4はGUI、コード、MCP、APIを通じてソフトウェアを操作する汎用エージェントとして説明されており、特定の業務システムでどこまで動くかは現時点で公表されていない。自社環境での検証が必要と考えられる。

用語解説

MoE(Mixture of Experts)
複数の専門家ネットワークのうち一部だけを活性化して推論するモデル構造。総パラメータを増やしつつ計算量を抑えられる。
MCP(Model Context Protocol)
AIモデルが外部ツールやデータソースに接続するための規格。エージェントがツールを呼び出す際の共通インターフェースとして使われる。
GUI
グラフィカルユーザーインターフェース。画面上のボタンやメニューをクリック・入力して操作する形態を指す。
ハーネス
モデルの出力する行動を実行し、数百ステップにわたって文脈を管理するループ。評価条件にも影響する。
強化学習
正解例だけでなく、試行の結果として得られる報酬をもとにモデルの振る舞いを改善する学習手法。
OSWorld 2.0
デスクトップ操作を評価するベンチマーク。原文ではHolo4の主要な性能指標として使われている。

出典

Holo4: powering generalist computer-use agents

Hugging Face / 2026年9月28日

https://huggingface.co/blog/Hcompany/holo4

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する