AI J.A.R.V.I.S. 最新テクノロジー

画面でもコードでも、同じ一体で動くAIエージェントが来る

更新日:

AI × テクノロジー

画面でもコードでも、同じ一体で動くAIエージェントが来る

Holo4は、画面のクリックからコード実行、MCPやAPI呼び出しまでを一つのモデルでこなすエージェント型モデル。27Bと35B-A3Bの2サイズで、デスクトップもWebもAndroidも同じ呼び方。OSWorld 2.0で27Bは61.7%。用途ごとにモデルを選び分ける手間が、要らなくなる。

📅 2026年9月
📖 読了約6分
🎯 AI を仕事と暮らしに使う人に

ブラウザ操作用のモデル、コード実行用のモデル、API連携用のモデル——やりたいことが一つなのに、Holo4の話を聞くまでは道具を三つ並べて迷っていたはずです。

STARKはH companyの発表資料を読み、2サイズの構成、対応する操作経路、ベンチマークの数値がどこまで公表されているかを確かめました。

読み終えたとき、自分の仕事がこのモデル一本に寄せられるものなのか、それともまだ様子を見る段階なのかが決まります。

出典:Hugging Face 公式発表「Holo4: powering generalist computer-use agents」(2026年9月28日)。本記事は一次情報を生活者の視点で読み解いたもの。数値・仕様は発表時点。
Holo4: powering generalist computer-use agents
① Holo4: powering generalist computer-use agents(出典:Hugging Face 公式発表)

1. Holo4は、何が発表されたのか

H companyが公開したのは、Holo4というエージェント型モデルのシリーズです。27Bのデンスモデルと、35B-A3BのMixture of Experts。どちらもH Models APIで使えて、重みはHugging Faceにも置かれました。同時にHolotron4 Nanoという小型モデルの更新版も発表されています。

01 「ソフトを操作する」の意味が広い

Holo4は画面をクリックして文字を打ちます。自分でコードを書いて走らせます。MCPやAPIのツールも呼びます。そのどれを使うかは、タスクに合わせてモデルが選ぶ。人間が「今回はGUIで」と決めてやる必要がない、という設計です。

多くのエージェント型モデルは、どれか一つの経路に特化して訓練されています。GUI前提のモデルは画面がなければ何も見えない。ツール呼び出し寄りのモデルは、APIを持たないアプリの前で立ち止まる。仕事は、そんなふうに区切られていません。

02 動く場所が、一つの呼び方でつながる

デスクトップ、Web、Android、コードサンドボックス、業務API。Holo4はこのすべてで動き、しかもどの場面でも同じモデル、同じ呼び出し方だと発表資料は書いています。プラットフォームごとに別のモデルを選ぶ設計から離れる、ということです。

訓練は教師ありと強化学習の両方。多数の環境とタスクが使われ、そこにはH companyのAgentic Task Factoryが生成したものも含まれます。ドキュメントやスクリーンショットだけから環境と検証可能なタスクを組み立てる仕組みで、これまでに約10,000のタスクを作ったとされています。

項目 発表内容
サイズ 27Bデンス / 35B-A3B(MoE)
操作経路 GUI・コード・MCP・API
動作環境 デスクトップ/Web/Android/コードサンドボックス/業務API
提供 H Models API、Hugging Face
重み形式 BF16 / FP8 / NVFP4 / 4bit GGUF
日本語対応の詳細 公式発表では未公表

2. 数字を、生活の尺度で読む

デスクトップ操作の難しいベンチマーク、OSWorld 2.0で、Holo4 27Bは61.7%。同じ指標でOpus 5.5は81.8%です。35B-A3Bは30.9%。トップには届いていません。ただしH companyは、桁違いに少ないパラメータ数で、はるかに低いコストで、と添えています。差の見方が変わる一文です。

01 「一番速い」ではなく「一回が安い」

長い作業の流れで最も強い閉じたモデルに、Holo4は一歩譲ります。そのかわり、1タスクあたりのコストで見たときに前線のモデルと競える位置にいる、という主張です。API使用(AutomationBench)でも同じ構図が語られています。

毎日何十回も回す作業なら、一回の単価は体感を左右します。精度が最高でなくても、気軽に何度も試せる。その気軽さが、使う頻度を変えていきます。

02 根拠を、全部見せている

公開ベンチマークのスコアの裏にあるトラジェクトリ——モデルが1歩ずつ何をしたかの記録——を、H companyはすべてオープンソースにしました。再生して確かめられる形です。数字だけを置いていく発表とは、姿勢が違います。

発表資料自体も、ベンチマークのバージョンや計測ハーネス、コストの前提を細かく注記しています。リリースやタスクの部分集合、ハーネスは各社で異なる、とも書かれている。比較表を鵜呑みにしないでほしい、という断りです。

3. 誰に向くか、まだ待つのは誰か

向くのは、自分の環境で重みを動かせる人と、業務の繰り返し作業をエージェントに任せたい現場です。GUIしかないアプリと、APIを持つシステムをまたぐ作業を一本化したい場面で効いてきます。逆に、最高精度を最優先するなら、まだ上のモデルを見る段階です。

01 手を出せる形になっている

両サイズがH Models APIで今日から使えます。重みはHugging Faceに、BF16・FP8・NVFP4・4bit GGUFの各形式で。4bit GGUFがあるということは、手元の環境で試す道も用意されている、ということです。

小型のHolotron4 Nanoも同じ場所に並びます。推論をさらに速めるDSpark drafterの最適化済みチェックポイントは、数日のうちに公開すると発表されています。

02 いま試すか、様子を見るか

試す価値があるのは、作業の手順が決まっていて、失敗しても取り返せる領域です。3Dモデリングやゲーム実装の例では、ベースのQwen3.8 27Bより少ない呼び出し回数とトークン数で仕上げたケースが示されています。効率が上がる余地はある、ということ。

一方で、業務データに直接触らせる運用や、日本語環境での挙動については、発表資料に細かい記述がありません。まずは影響範囲の小さいタスクで、動きを自分の目で見る。それが順番です。

4. 決めるなら、ここから始める

結論。Holo4は「どのモデルを選ぶか」という悩みを一段減らしてくれるモデルです。GUIもコードもAPIも一本で、しかも重みが手元に降りてくる。最高精度ではない。でも、回数を重ねられる価値は、精度表には載りません。今日から触れる形になっているなら、触ってみる番です。

01 最初の一歩は、小さいタスクで

やることは決まっています。H Models APIのクイックスタートを開いて、いま人間が毎日繰り返している作業を一つ選ぶ。画面操作とAPI呼び出しが混ざっているものほど、Holo4の設計が効きます。それを一回投げて、トラジェクトリを見る。

手元で動かしたいなら4bit GGUFから。重い形式に進むのは、挙動に納得してからでいい。公開されているトラジェクトリを先に眺めておくと、どこでつまずくモデルなのかの当たりが付きます。

02 待ってもいい人

最高スコアが必要な仕事、失敗コストが大きい仕事なら、急ぐ理由はありません。OSWorld 2.0の差は、まだはっきり残っています。DSpark drafterの公開を待って、推論の速さを含めて判断するのも一つの選び方です。

それでも、この発表が指している方向は覚えておく価値があります。モデルを用途で選び分ける時代が、そろそろ終わりに向かっている。機能が増えたのではなく、選び方が変わる。そういう発表です。

📄

Hugging Faceの公式発表を原文で確認する

一次情報:Holo4 の発表(Hugging Face 公式)

公式発表を読む

5. よくある質問

Holo4のサイズは何種類?

2種類です。27Bのデンスモデルと、35B-A3BのMixture of Experts。どちらもH Models APIで利用でき、重みはHugging Faceに公開されています。サイズによって呼び出し方が変わることはないと発表資料は説明しています。

OSWorld 2.0のスコアはどれくらい?

Holo4 27Bが61.7%、35B-A3Bが30.9%です。同じ指標でOpus 5.5は81.8%。H companyは、桁違いに少ないパラメータ数とはるかに低いコストでこの水準に届いていると説明しています。ハーネスやタスクの部分集合は各社で異なる点に注記があります。

どこで使える?

デスクトップ、Web、Android、コードサンドボックス、業務APIです。すべて同一のモデル、同一の呼び出し方で扱えるとされています。プラットフォームごとに別のモデルを選ぶ必要はないという設計です。

自分のPCで動かせる?

重みがHugging FaceにBF16・FP8・NVFP4・4bit GGUFの各形式で公開されています。4bit GGUFは手元環境向けの形式です。ただし必要なハードウェア要件について、公式発表では未公表です。

日本語での操作に対応している?

発表資料に日本語対応の記述はありません。訓練はWebアプリ、MCPサーバー、デスクトップ環境の多数のタスクで行われたと説明されていますが、言語ごとの挙動については触れられていません。

ベンチマークの根拠は確認できる?

できます。公開ベンチマークのスコアの裏にあるトラジェクトリ、つまりモデルが1歩ずつ何をしたかの記録を、H companyはすべてオープンソースにしています。1ステップずつ再生する形で確認できるとされています。

6. まとめ

Holo4 — 結論と、いま決めること

Holo4が変えるのは、性能の順位ではありません。道具の選び方です。GUIしかないアプリと、APIを持つシステム。今まで別のモデルに割り振っていたものが、一本にまとまる。OSWorld 2.0で27Bは61.7%、上には81.8%がある。それでも、1タスクのコストが下がって何度でも回せるなら、実際に片付く仕事の量は変わってきます。重みは今日からHugging Faceにあります。触って決める段階に、もう入っています。

  • 2サイズ:27Bデンスと35B-A3B MoEの2種類
  • 操作経路:GUI・コード・MCP・APIを同一モデルで
  • 動作範囲:デスクトップ/Web/Android/API
  • スコア:OSWorld 2.0で27Bが61.7%
  • 入手:H Models APIとHugging Faceで公開中

7. 画像の出典

本記事の画像(アイキャッチを除く)はいずれも下記から取得したもので、著作権は各権利者に帰属する。発表元が公開している報道用素材を、出典を明記して掲載している。掲載の停止・差し替えのご連絡はお問い合わせから。

-AI, J.A.R.V.I.S., 最新テクノロジー

Copyright© Killer Picks Express – AIが創造する未来の選択 , 2026 All Rights Reserved.