AI 最新テクノロジー

エージェントの『できました』は、20回続けて初めて信じられる

投稿日:

AI × エージェント

エージェントの『できました』は、20回続けて初めて信じられる

ThinkingBox は、エージェントの「できました」を文章ではなく台帳の最終状態で採点します。同じ仕事を 20 回やらせて、毎回同じ結果になるかまで見る。Microsoft と Hugging Face が公開した箱は、自分の PC でも動かせます。

📅 2026年10月
📖 読了約6分
🎯 AI を仕事と暮らしに使う人に

自分で組んだエージェントに手続きを任せて、「完了しました」と返ってきたのに、あとでデータを見たら何も変わっていなかった。ThinkingBox が測るのは、まさにその落差です。

私は Microsoft と Hugging Face の共同発表を読み、507 の業務ワークフローを 20 回ずつ走らせた結果と、自分の環境で動かすための条件を拾いました。

読み終えたとき、自分のエージェントにどのモデルを置くか、そして合否の判定を言葉から記録に移すかを決められます。

出典:Hugging Face 公式発表「The Agent Said It Was Done. The Database Disagreed.」(2026年10月4日)。本記事は一次情報を生活者の視点で読み解いたもの。数値・仕様は発表時点。
The Agent Said It Was Done. The Database Disagreed.
① The Agent Said It Was Done. The Database Disagreed.(出典:Hugging Face 公式発表)

1. 台帳は「まだ終わっていない」と言った

発表の核心は、採点の場所を変えたことです。これまでエージェントの出来は、ツールを正しく呼べたか、最後の返答が筋の通った文章になっているかで測られてきました。ThinkingBox が見るのは、仕事が終わったあとのデータベースだけ。何が書き換わり、何が余計に増え、何が抜けたか。言葉は証拠になりません。

01. 九回の正しい手つきと、一つの未解決

発表資料の例はこうです。745 ドルのキッチン家電が、ナッシュビルの配送拠点で「例外」のまま止まり、到着予定日から 15 日が過ぎている。エージェントは注文を引き、追跡を確認し、顧客情報を見て、返金規定を二度調べ、チケットを立て、経緯を書き残しました。ツール呼び出しは九回、どれも形は正しい。規定の読みも正しく、この顧客の区分は遅延補償の対象外でした。

それでもエージェントはチケットを「解決済み」にして、ご用件は解決しましたのでほかに何かございますか、と返した。配送の例外はまだ開いたままで、本来の正解は「保留、対応待ち」でした。顧客が本当に聞きたかったことには、答えが返っていません。落ちた検査はたった一項目、チケットの状態という単一のフィールドです。

手つきを見る採点者には、九回のきれいな呼び出ししか見えない。否定したのは台帳のほうでした。

02. 静かに失敗する、という失敗

規模で見ると、この落差は例外ではありません。12 モデル・121,680 試行を揃えた比較では、79,853 回が実行可能な検査に落ちています。そのうち 67.24% は、きちんと終了し、状態を変えるツールを呼び、最後のツールエラーも出していません。外から見れば、成功と区別がつかない失敗です。

検査が見つけたのは、値そのものの間違いが 77.61%、意図しない余計な変更が 43.30%、必要な変更の抜けが 25.36%(重複あり)。ThinkingBox と ThinkingBox-Bench は Microsoft Copilot Studio チームが Toloka と組んで作ったもので、507 タスクのうち 477 は状態だけで採点し、30 だけが返答の評価項目を足しています。

軌跡は主張。データベースは証拠。反復は、信用の試験。

分離されたセッションを初期化し、エージェントが MCP ツールで作業し、変化した内容を抽出して、要求された最終状態と突き合わせて合否を一つ返す流れの図ThinkingBox — 仕組み毎回まっさらな箱で動かし、残った記録だけを見る1初期化まっさらな状態の専用セッションを一つ用意する2実行エージェントが MCP ツールを使って作業を進める3副作用抽出実際に何が変わったかを記録から取り出す4判定要求された最終状態と突き合わせ、合否を返すKILLER PICKS EXPRESS
毎回まっさらな箱で動かし、残った記録だけを見る

2. 一回できたは、できるではない

返金を一度正しく処理して、次の四回を取りこぼすなら、それは動く返金エージェントではありません。だから ThinkingBox は 507 のタスクをそれぞれ 20 回、毎回同じまっさらな状態から走らせます。報告する数字は三つ。ふだんどうか、一度でもできるか、いつでもできるか。この三つは、別のことを聞いています。

01. 三つの数字が、別のことを聞いている

pass@1 は全試行のうち成功した割合で、ふだんの実力。pass@20 は 20 回で一度でも解けたタスクの割合で、届く範囲の広さ。そして observed 20/20 は、20 回すべて通ったタスクの実数です。推定も平滑化もせず、数えた数字をそのまま出しています。

ふだんの実力で並べると、首位は Claude Opus 5.5 の 67.16%、次が Claude Opus 5 の 66.50%。オープンウェイトでは Kimi-K3 が 57.37% で最も強く、GPT-6 Astra に 1 ポイント以内まで迫ります。

ただし領域で景色が変わります。Claude Opus 4.6 は小売で 68.62% なのに、自動車保険では 8.30%。表に載ったモデルの平均でも、小売 59.52% に対して自動車保険は 33.83% でした。得意な家事と苦手な家事がある、という話に近い。

507 タスクを 20 回ずつ走らせ、Claude Opus 5.5 が毎回通したのは 241 タスクだったことを示す数字の図ThinkingBox-Bench — 規模同じ仕事を 20 回。残るのは半分以下だった507タスク対象の業務ワークフロー20回反復毎回まっさらな状態から241毎回正解Opus 5.5 の 20/20 タスクKILLER PICKS EXPRESS
同じ仕事を 20 回。残るのは半分以下だった

02. pass@1 が残るモデル、溶けるモデル

一度の点数が 20 回の反復でどれだけ残るか。踏みとどまったのは三つだけで、GPT-6 Astra が 78%、Claude Opus 5.5 と Claude Opus 5 がそれぞれ 71% を保ちました。反対の端では GLM-5.1、Kimi-K2.6、DeepSeek-V4-Pro がいずれも 8% 前後まで落ちます。

新しいほうが強い、とも言い切れません。Claude Opus 5.5 は Claude Opus 5 より平均点が高く、一度でも解けたタスクも多い。それでも 20 回すべて通ったタスク数は、どちらも 241 で同じでした。半ポイントの精度は、確実さを一つも買っていない。

指標 答える問い
pass@1 ふだんどうか(全試行のうち成功した割合)
pass@20 一度でもできるか(20 回で最低 1 回解けた割合)
observed 20/20 いつでもできるか(20 回すべて通ったタスク数)

3. 任せる相手は、値段でも選べる

費用の見方も二つに割れます。一回の正解が安いモデルと、毎回の正解が安いモデルは別物でした。一回あたりで並べると最安は GPT-5.6 Sol の $0.127、そこから GPT-5.4 が $0.004 の上乗せで 3.45 ポイント、Claude Opus 5.5 が $0.276 でさらに 1.80 ポイントを足す。どれも比較のための指標で、請求書ではありません。

01. 広さと確実さは、別の列

Kimi-K3 は届く範囲がいちばん広い。507 タスクのうち 476、93.89% を一度は解き、完全に歯が立たなかったのは 31 だけでした。小売では 82.24% で、どの商用モデルより前に出ています。

一方で 20 回すべて通ったのは 68 タスク、13.41%。Claude Opus 5 はここが逆で、一度でも解けたのは 79.09%(106 タスクには届かない)ですが、47.53% を毎回通しました。Kimi-K3 は 75 タスク多く「一度は」解き、Opus 5 は 173 タスク多く「毎回」解く。

実際の記録に触る仕事を任せるなら、見るべき列は pass@20 ではない、というのが発表の言い方です。

Kimi-K3 は一度でも解けたタスクが多く、Claude Opus 5 は 20 回すべて通したタスクが多いという対比の図
一度でも解けるかと、毎回解けるかは別のモデルが勝つ

02. 一回の正解と、毎回の正解の値段

毎回の確実さに値段をつけると、順番が入れ替わります。20 回まるごと走らせた費用を、20/20 を通したタスク数で割る。最安は GPT-5.4 の $6.80 ですが、その基準に届いたのは 128 タスクだけ。GPT-6 Astra は 231 タスクで $7.45、Claude Opus 5.5 は最多の 241 タスクで $7.80 でした。

一回の正解が最も安かった GPT-5.6 Sol は、確実さで見ると $9.76。Claude Opus 5 は 241 タスクを通すものの $13.30 で、Opus 5.5 に完全に追い越されています。いちばん安く正解を得る道は、いちばん安く確実さを得る道ではない。価格は OpenRouter の定価、2026 年 9 月 20 日時点のスナップショットが根拠です。

03. 転ぶのは、頭ではなく手つき

失敗の中身は、意外なほど地味でした。診断の内訳は、ツールの扱いが 79.9%、状態の更新間違いが 10.3%、ユーザーへの対応が終わっていないものが 7.0%、状態を変える行動を取らなかったものが 2.9%。おおよそ五つに四つが、推論より手つきの問題です。

パターンも素直です。エージェントはだいたい作業に取りかかるところまでは進み、そこでツールのエラーや前提条件の失敗、空の検索結果から立ち直れない。つまりモデルを替える前に、再試行とエラー処理を直す余地がある、という読み方ができます。

モデル 20/20 タスク 1 件あたり
GPT-5.4 128(25.25%) $6.80
GPT-6 Astra 231(45.56%) $7.45
Claude Opus 5.5 241(47.53%) $7.80
GPT-5.6 Sol 82(16.17%) $9.76
Claude Opus 5 241(47.53%) $13.30
Claude Sonnet 4.6 102(20.12%) $15.56
Kimi-K3 68(13.41%) $20.68

4. 自分の環境に、今日入れられる

ここがいちばんおいしいところです。ThinkingBox はハーネスもデータセットも Hugging Face に出ていて、コードは MIT、ベンチマークのデータは CDLA-Permissive-2.0、OpenEnv 環境は BSD-3-Clause。つまり自分の部屋の機械で、自分のエージェントに同じ試験を受けさせられる。しかも採点のやり方だけなら、今日から真似できます。

01. 用意するもの

動作確認が取れているのは Linux と WSL で、Python 3.11+、uv、Docker が前提です。加えて固定リリースの thinkingbox-data を手元に置き、エージェント役・模擬ユーザー役・判定役の三つにモデルのエンドポイントを割り当てます。一つのエンドポイントで三役を兼ねられるので、まず動かすならそれが最短です。

端末は三つ。二つめで Typesense 30.1 を立ててヘルスチェックを待ち、三つめで Session Proxy と MCP サーバーを起動し、一つめで YAML 設定を指して OpenEnv サーバーを上げる。readiness は条件が揃うまで 503 を返し続けるので、そこで止めてから走らせる。Typesense と各モデルのエンドポイントだけは別に確かめる必要があります。エピソードごとに返るのは、pass か fail の二値です。

02. ベンチマークを回さなくても、真似られる

発表が勧めているのは、同じ信号を本番側でも取ることです。コミットする前に、モデルの要約ではなく最終状態そのものを確認する。ツールとシステムのエラーを分類して、再試行は回復できるものだけに向ける。使わせるツールの面積を、そのワークフローに必要な分まで削る。そして安く取り消せない変更には、人の承認を挟む。

どれも、どれだけ成績が上がるかはこのベンチマークでは未計測だと、発表は正直に書いています。だから測れる。自分の部屋のエージェントに、まず一問だけ試験を作る。カーテンでも照明でも家計簿でもいい、「言いました」ではなく「変わっていました」で合否を出す。それを 20 回。ここを越えた仕事から、エージェントは任せられる相手になっていきます。

📄

Hugging Faceの公式発表を原文で確認する

一次情報:The Agent Said It Was Done. The Database Disagreed.

公式発表を読む

5. よくある質問

ThinkingBox は無料で使えますか

ハーネスとデータセットが Hugging Face で公開されています。コードは MIT ライセンス、ベンチマークのデータは CDLA-Permissive-2.0、OpenEnv 環境は BSD-3-Clause。自分でモデルのエンドポイントを用意して走らせる形になります。

Windows でも動きますか

動作が確認されているのは Linux と WSL です。WSL 上に Python 3.11+、uv、Docker を揃え、固定リリースの thinkingbox-data と三役ぶんのモデルエンドポイントがあれば起動できます。Typesense 30.1 と MCP サーバーは別の端末で立てます。

いちばん確実なモデルはどれですか

20 回すべて通したタスク数では Claude Opus 5.5 と Claude Opus 5 がどちらも 241 で並び、全体平均は Opus 5.5 の 67.16% が首位でした。ただし毎回の正解 1 件あたりの費用では Opus 5.5 が $7.80、Opus 5 が $13.30 と差がつきます。

オープンウェイトでも戦えますか

Kimi-K3 は 507 タスクのうち 476、93.89% を一度は解き、小売では 82.24% で全モデルの先頭に立ちました。一方で 20 回すべて通ったのは 68 タスク、13.41%。広さは出せても、毎回の確実さは別の話になります。

日本語のタスクはありますか

公式発表では未公表です。公開されているのは小売や自動車保険などの業務ワークフローで、タスクはすべて合成された再構成だと明記されています。日本語で試したい場合は、同じ仕組みを使って自分でシナリオを作る形になります。

出てくる顧客は実在しますか

実在しません。公開ベンチマークの全タスクが合成による再構成で、ワークフローと規定は実際の業務エージェントのパターンをもとに作られていますが、顧客は架空だと発表に書かれています。

6. まとめ

ThinkingBox — 結論と、いま決めること

示されたのは順位表ではなく、採点の場所です。文章ではなく台帳。一回ではなく 20 回。507 タスクのうち毎回通ったのは、首位でも 241 でした。ここを知ったうえで、自分のエージェントに最初の一問を作る。「できました」ではなく「変わっていました」で合否を出す。それだけで、どこまで任せられるかの線が見えてきます。コードも環境も公開済み。試す側に回る準備は、もう整っています。

  • 採点対象:返答ではなく最終状態を見る
  • 反復回数:同じ仕事を 20 回、毎回まっさらから
  • 見る列:pass@20 ではなく 20/20 で判断する
  • 費用の軸:毎回の正解 1 件あたりで比べる
  • 動かす前:WSL か Linux、Python 3.11+、Docker

7. 画像の出典

本記事の画像(アイキャッチを除く)はいずれも下記から取得したもので、著作権は各権利者に帰属する。発表元が公開している報道用素材を、出典を明記して掲載している。掲載の停止・差し替えのご連絡はお問い合わせから。

-AI, 最新テクノロジー

Copyright© Killer Picks Express , 2026 All Rights Reserved.