ThinkingBox は、エージェントの「できました」を文章ではなく台帳の最終状態で採点します。同じ仕事を 20 回やらせて、毎回同じ結果になるかまで見る。Microsoft と Hugging Face が公開した箱は、自分の PC でも動かせます。
自分で組んだエージェントに手続きを任せて、「完了しました」と返ってきたのに、あとでデータを見たら何も変わっていなかった。ThinkingBox が測るのは、まさにその落差です。
私は Microsoft と Hugging Face の共同発表を読み、507 の業務ワークフローを 20 回ずつ走らせた結果と、自分の環境で動かすための条件を拾いました。
読み終えたとき、自分のエージェントにどのモデルを置くか、そして合否の判定を言葉から記録に移すかを決められます。

1. 台帳は「まだ終わっていない」と言った
発表の核心は、採点の場所を変えたことです。これまでエージェントの出来は、ツールを正しく呼べたか、最後の返答が筋の通った文章になっているかで測られてきました。ThinkingBox が見るのは、仕事が終わったあとのデータベースだけ。何が書き換わり、何が余計に増え、何が抜けたか。言葉は証拠になりません。
01. 九回の正しい手つきと、一つの未解決
発表資料の例はこうです。745 ドルのキッチン家電が、ナッシュビルの配送拠点で「例外」のまま止まり、到着予定日から 15 日が過ぎている。エージェントは注文を引き、追跡を確認し、顧客情報を見て、返金規定を二度調べ、チケットを立て、経緯を書き残しました。ツール呼び出しは九回、どれも形は正しい。規定の読みも正しく、この顧客の区分は遅延補償の対象外でした。
それでもエージェントはチケットを「解決済み」にして、ご用件は解決しましたのでほかに何かございますか、と返した。配送の例外はまだ開いたままで、本来の正解は「保留、対応待ち」でした。顧客が本当に聞きたかったことには、答えが返っていません。落ちた検査はたった一項目、チケットの状態という単一のフィールドです。
手つきを見る採点者には、九回のきれいな呼び出ししか見えない。否定したのは台帳のほうでした。
02. 静かに失敗する、という失敗
規模で見ると、この落差は例外ではありません。12 モデル・121,680 試行を揃えた比較では、79,853 回が実行可能な検査に落ちています。そのうち 67.24% は、きちんと終了し、状態を変えるツールを呼び、最後のツールエラーも出していません。外から見れば、成功と区別がつかない失敗です。
検査が見つけたのは、値そのものの間違いが 77.61%、意図しない余計な変更が 43.30%、必要な変更の抜けが 25.36%(重複あり)。ThinkingBox と ThinkingBox-Bench は Microsoft Copilot Studio チームが Toloka と組んで作ったもので、507 タスクのうち 477 は状態だけで採点し、30 だけが返答の評価項目を足しています。
軌跡は主張。データベースは証拠。反復は、信用の試験。
2. 一回できたは、できるではない
返金を一度正しく処理して、次の四回を取りこぼすなら、それは動く返金エージェントではありません。だから ThinkingBox は 507 のタスクをそれぞれ 20 回、毎回同じまっさらな状態から走らせます。報告する数字は三つ。ふだんどうか、一度でもできるか、いつでもできるか。この三つは、別のことを聞いています。
01. 三つの数字が、別のことを聞いている
pass@1 は全試行のうち成功した割合で、ふだんの実力。pass@20 は 20 回で一度でも解けたタスクの割合で、届く範囲の広さ。そして observed 20/20 は、20 回すべて通ったタスクの実数です。推定も平滑化もせず、数えた数字をそのまま出しています。
ふだんの実力で並べると、首位は Claude Opus 5.5 の 67.16%、次が Claude Opus 5 の 66.50%。オープンウェイトでは Kimi-K3 が 57.37% で最も強く、GPT-6 Astra に 1 ポイント以内まで迫ります。
ただし領域で景色が変わります。Claude Opus 4.6 は小売で 68.62% なのに、自動車保険では 8.30%。表に載ったモデルの平均でも、小売 59.52% に対して自動車保険は 33.83% でした。得意な家事と苦手な家事がある、という話に近い。
02. pass@1 が残るモデル、溶けるモデル
一度の点数が 20 回の反復でどれだけ残るか。踏みとどまったのは三つだけで、GPT-6 Astra が 78%、Claude Opus 5.5 と Claude Opus 5 がそれぞれ 71% を保ちました。反対の端では GLM-5.1、Kimi-K2.6、DeepSeek-V4-Pro がいずれも 8% 前後まで落ちます。
新しいほうが強い、とも言い切れません。Claude Opus 5.5 は Claude Opus 5 より平均点が高く、一度でも解けたタスクも多い。それでも 20 回すべて通ったタスク数は、どちらも 241 で同じでした。半ポイントの精度は、確実さを一つも買っていない。
| 指標 | 答える問い |
|---|---|
| pass@1 | ふだんどうか(全試行のうち成功した割合) |
| pass@20 | 一度でもできるか(20 回で最低 1 回解けた割合) |
| observed 20/20 | いつでもできるか(20 回すべて通ったタスク数) |
3. 任せる相手は、値段でも選べる
費用の見方も二つに割れます。一回の正解が安いモデルと、毎回の正解が安いモデルは別物でした。一回あたりで並べると最安は GPT-5.6 Sol の $0.127、そこから GPT-5.4 が $0.004 の上乗せで 3.45 ポイント、Claude Opus 5.5 が $0.276 でさらに 1.80 ポイントを足す。どれも比較のための指標で、請求書ではありません。
01. 広さと確実さは、別の列
Kimi-K3 は届く範囲がいちばん広い。507 タスクのうち 476、93.89% を一度は解き、完全に歯が立たなかったのは 31 だけでした。小売では 82.24% で、どの商用モデルより前に出ています。
一方で 20 回すべて通ったのは 68 タスク、13.41%。Claude Opus 5 はここが逆で、一度でも解けたのは 79.09%(106 タスクには届かない)ですが、47.53% を毎回通しました。Kimi-K3 は 75 タスク多く「一度は」解き、Opus 5 は 173 タスク多く「毎回」解く。
実際の記録に触る仕事を任せるなら、見るべき列は pass@20 ではない、というのが発表の言い方です。

02. 一回の正解と、毎回の正解の値段
毎回の確実さに値段をつけると、順番が入れ替わります。20 回まるごと走らせた費用を、20/20 を通したタスク数で割る。最安は GPT-5.4 の $6.80 ですが、その基準に届いたのは 128 タスクだけ。GPT-6 Astra は 231 タスクで $7.45、Claude Opus 5.5 は最多の 241 タスクで $7.80 でした。
一回の正解が最も安かった GPT-5.6 Sol は、確実さで見ると $9.76。Claude Opus 5 は 241 タスクを通すものの $13.30 で、Opus 5.5 に完全に追い越されています。いちばん安く正解を得る道は、いちばん安く確実さを得る道ではない。価格は OpenRouter の定価、2026 年 9 月 20 日時点のスナップショットが根拠です。
03. 転ぶのは、頭ではなく手つき
失敗の中身は、意外なほど地味でした。診断の内訳は、ツールの扱いが 79.9%、状態の更新間違いが 10.3%、ユーザーへの対応が終わっていないものが 7.0%、状態を変える行動を取らなかったものが 2.9%。おおよそ五つに四つが、推論より手つきの問題です。
パターンも素直です。エージェントはだいたい作業に取りかかるところまでは進み、そこでツールのエラーや前提条件の失敗、空の検索結果から立ち直れない。つまりモデルを替える前に、再試行とエラー処理を直す余地がある、という読み方ができます。
| モデル | 20/20 タスク | 1 件あたり |
|---|---|---|
| GPT-5.4 | 128(25.25%) | $6.80 |
| GPT-6 Astra | 231(45.56%) | $7.45 |
| Claude Opus 5.5 | 241(47.53%) | $7.80 |
| GPT-5.6 Sol | 82(16.17%) | $9.76 |
| Claude Opus 5 | 241(47.53%) | $13.30 |
| Claude Sonnet 4.6 | 102(20.12%) | $15.56 |
| Kimi-K3 | 68(13.41%) | $20.68 |
4. 自分の環境に、今日入れられる
ここがいちばんおいしいところです。ThinkingBox はハーネスもデータセットも Hugging Face に出ていて、コードは MIT、ベンチマークのデータは CDLA-Permissive-2.0、OpenEnv 環境は BSD-3-Clause。つまり自分の部屋の機械で、自分のエージェントに同じ試験を受けさせられる。しかも採点のやり方だけなら、今日から真似できます。
01. 用意するもの
動作確認が取れているのは Linux と WSL で、Python 3.11+、uv、Docker が前提です。加えて固定リリースの thinkingbox-data を手元に置き、エージェント役・模擬ユーザー役・判定役の三つにモデルのエンドポイントを割り当てます。一つのエンドポイントで三役を兼ねられるので、まず動かすならそれが最短です。
端末は三つ。二つめで Typesense 30.1 を立ててヘルスチェックを待ち、三つめで Session Proxy と MCP サーバーを起動し、一つめで YAML 設定を指して OpenEnv サーバーを上げる。readiness は条件が揃うまで 503 を返し続けるので、そこで止めてから走らせる。Typesense と各モデルのエンドポイントだけは別に確かめる必要があります。エピソードごとに返るのは、pass か fail の二値です。
02. ベンチマークを回さなくても、真似られる
発表が勧めているのは、同じ信号を本番側でも取ることです。コミットする前に、モデルの要約ではなく最終状態そのものを確認する。ツールとシステムのエラーを分類して、再試行は回復できるものだけに向ける。使わせるツールの面積を、そのワークフローに必要な分まで削る。そして安く取り消せない変更には、人の承認を挟む。
どれも、どれだけ成績が上がるかはこのベンチマークでは未計測だと、発表は正直に書いています。だから測れる。自分の部屋のエージェントに、まず一問だけ試験を作る。カーテンでも照明でも家計簿でもいい、「言いました」ではなく「変わっていました」で合否を出す。それを 20 回。ここを越えた仕事から、エージェントは任せられる相手になっていきます。
5. よくある質問
ThinkingBox は無料で使えますか
ハーネスとデータセットが Hugging Face で公開されています。コードは MIT ライセンス、ベンチマークのデータは CDLA-Permissive-2.0、OpenEnv 環境は BSD-3-Clause。自分でモデルのエンドポイントを用意して走らせる形になります。
Windows でも動きますか
動作が確認されているのは Linux と WSL です。WSL 上に Python 3.11+、uv、Docker を揃え、固定リリースの thinkingbox-data と三役ぶんのモデルエンドポイントがあれば起動できます。Typesense 30.1 と MCP サーバーは別の端末で立てます。
いちばん確実なモデルはどれですか
20 回すべて通したタスク数では Claude Opus 5.5 と Claude Opus 5 がどちらも 241 で並び、全体平均は Opus 5.5 の 67.16% が首位でした。ただし毎回の正解 1 件あたりの費用では Opus 5.5 が $7.80、Opus 5 が $13.30 と差がつきます。
オープンウェイトでも戦えますか
Kimi-K3 は 507 タスクのうち 476、93.89% を一度は解き、小売では 82.24% で全モデルの先頭に立ちました。一方で 20 回すべて通ったのは 68 タスク、13.41%。広さは出せても、毎回の確実さは別の話になります。
日本語のタスクはありますか
公式発表では未公表です。公開されているのは小売や自動車保険などの業務ワークフローで、タスクはすべて合成された再構成だと明記されています。日本語で試したい場合は、同じ仕組みを使って自分でシナリオを作る形になります。
出てくる顧客は実在しますか
実在しません。公開ベンチマークの全タスクが合成による再構成で、ワークフローと規定は実際の業務エージェントのパターンをもとに作られていますが、顧客は架空だと発表に書かれています。
6. まとめ
示されたのは順位表ではなく、採点の場所です。文章ではなく台帳。一回ではなく 20 回。507 タスクのうち毎回通ったのは、首位でも 241 でした。ここを知ったうえで、自分のエージェントに最初の一問を作る。「できました」ではなく「変わっていました」で合否を出す。それだけで、どこまで任せられるかの線が見えてきます。コードも環境も公開済み。試す側に回る準備は、もう整っています。
- 採点対象:返答ではなく最終状態を見る
- 反復回数:同じ仕事を 20 回、毎回まっさらから
- 見る列:pass@20 ではなく 20/20 で判断する
- 費用の軸:毎回の正解 1 件あたりで比べる
- 動かす前:WSL か Linux、Python 3.11+、Docker
7. 画像の出典
- ① Hugging Face 公式発表・表示の安定のため当サイトのサーバーで配信




