この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 507の業務ワークフローを20回ずつ実行し、最終的なDB状態と副作用を採点するベンチマーク
  • 実行可能チェックに失敗した79,853件のうち67.24%は正常終了として報告されていた
  • 20回すべて成功したタスク数はモデル間で大きく異なり、GPT-6 Astraは231、Claude Opus 5.5は241

何が発表されたのか

MicrosoftとHugging Faceが共同ブログで、AIエージェント向けのサンドボックス「ThinkingBox」と、データセット型ベンチマーク「ThinkingBox-Bench」を発表しました。特徴は、エージェントの最終応答やツール呼び出しの形式ではなく、実行後にバックエンド(データベース)に残った最終状態と副作用を採点する点にあります。対象は507の状態を持つ業務ワークフローで、各タスクが複数のLLMに対して20回ずつ実行されています。

各タスクには、開始時のバックエンド状態、ユーザーの目的、利用可能なMCPツール、ドメインポリシー、最終状態に対する実行可能チェックが定義されます。模擬ユーザーは予約参照番号や生年月日といった非公開の文脈を保持し、聞かれたときだけ開示します。各試行は新しく初期化された状態の隔離されたMCPセッションを与えられ、同じタスクの2回の試行がデータベースの行を共有することはないと説明されています。

ブログの冒頭には、745ドルの家電が配送業者の「例外」状態のまま15日遅延しているという例が示されます。エージェントは9回のツール呼び出しを行い、返金ポリシーを2度確認し、対象外という判断も正しく下しました。しかしチケットを解決済みとして閉じており、本来必要とされる最終状態(保留)とは異なる状態を残してしまった、という例です。

ツール呼び出しは成果ではない

著者らは、最終応答や妥当なツール呼び出しはあくまで代理指標にすぎないと位置づけます。エージェントは正しく聞こえても、誤った値を書き込んだり、誤ったレコードを変更したり、余計な副作用を生んだりしうるためです。121,680件の有効試行を含む共通セットのアブレーションでは、79,853件が実行可能チェックに失敗しました。そのうち67.24%は正常に終了し、状態を変えるツールを呼び、最終的なツールエラーも報告していませんでした。

実行可能チェックは、そうした失敗のうち77.61%で誤ったフィールド値を検出し、43.30%で意図しない追加効果、25.36%で必須の効果の欠落を検出しています(これらの検出は重複します)。著者らは「軌跡は主張であり、データベースの状態が証拠である。反復が信頼性のテストになる」とまとめています。ログ上の成功と、データが実際に正しい状態になったかどうかは別問題だという整理です。

一貫性とそのコスト

pass@1(1回だけ試行したときの成功率の推定値)では、Claude Opus 5.5が67.16%で首位、Claude Opus 5が66.50%と僅差で続きます。Kimi-K3はオープンウェイトのモデルとして最強で、GPT-6-Astraと1ポイント以内でした。ドメインによる差も大きく、Claude Opus 4.6は小売で68.62%を記録する一方、自動車保険では8.30%にとどまっています。

20回の反復にどれだけスコアが残るかを見ると、GPT-6 Astraが単発スコアの78%、Claude Opus 5.5とClaude Opus 5がそれぞれ71%を維持しました。一方でGLM-5.1、Kimi-K2.6、DeepSeek-V4-Proは約8%しか残りません。広さと一貫性も分離します。Kimi-K3は507タスク中476件(93.89%)を少なくとも1回は解きますが、20回すべて成功したのは68件(13.41%)だけです。Claude Opus 5は逆に、少なくとも1回解けたのは79.09%で106タスクは全く解けませんが、47.53%を毎回成功させています。

コストは「成功した試行あたり」と「信頼できるタスクあたり」の2通りで測られます。前者ではGPT-5.6 Solが0.127ドルで最も安く、GPT-5.4が0.004ドル高くしてpass@1を3.45ポイント引き上げ、Claude Opus 5.5がさらに1.80ポイント上げて0.276ドルとなっています。後者では順位が変わり、GPT-5.4が6.80ドルで最安ですが合格は128タスクのみ、GPT-6 Astraは231タスクで7.45ドル、Claude Opus 5.5は241タスクで7.80ドルです。単発で最も安いGPT-5.6 Solは信頼タスクあたり9.76ドルでした。

失敗の傾向と未確認の点

失敗の傾向について、著者らは約5件に4件が推論ではなくツール処理に起因すると述べています。エージェントはワークフローを試みる段階までは進むものの、ツールエラーや満たされない前提条件、空の検索結果から回復できないというパターンです。対策として、コミット前に最終状態を確認すること、ツールやシステムのエラーを分類して再試行の対象を絞ること、ツールの面を業務に必要な分だけに削ること、戻せない変更には人手の承認を要求することを挙げています。

ただし著者らは、これらの対策によるスコアの改善幅はこのベンチマークではまだ測っていないと明記しています。「環境がテスト可能にする種類のもの」だとするにとどまります。またドメインによる難易度差も示され、対象モデル全体で小売は平均59.52%、自動車保険は平均33.83%のpass@1でした。コストの数値はOpenRouter+の割引なしリスト価格による推定であり、実際のクラウド請求額でも本番1リクエストの価格でもないと注記されています。

20/20で合格したタスク数と推定コストの比較
モデル20/20で合格したタスク数信頼タスク1件あたりの推定コスト
GPT-5.4128$6.80
GPT-6 Astra231$7.45
Claude Opus 5.5241$7.80
Claude Opus 5241$13.30
原文からの引用
A trajectory is a claim. Database state is the evidence. Repetition is the trust test.

軌跡は主張であり、データベースの状態が証拠である。反復が信頼性のテストになる。

今後の見通し

著者らは、コミット前の最終状態確認、ツールエラーの分類、ツール面の削減、戻せない変更への人手承認といった対策を挙げています。ただし、これらによるスコア改善はこのベンチマークではまだ測られていないと明記されており、効果の大きさは今後の追試を待つ必要があります。エージェントを実運用に投入する企業にとっては、pass@1だけでなく20回連続で成功する割合と、その1件あたりのコストが判断材料になるとみられます。どのモデルがどの業務ドメインで安定するかは、ドメイン別の20/20スコアが示されれば判断しやすくなります。

日本の開発者・IT企業にとっての意味

AIエージェントを業務システムにつなぐ開発では、これまでツール呼び出しの形式や最終応答の自然さが評価の中心になりがちでした。ThinkingBoxの結果は、それだけでは不十分で、エージェントが書き換えたレコードや生んだ副作用を、実行可能なチェックで検証する必要があることを示しています。社内システムや受発注、カスタマーサポートにエージェントを組み込む場合、失敗した試行の約3分の2が正常終了として報告されていたという指摘は無視できません。ログ上は成功に見えてもデータが壊れている可能性があるため、コミット前の最終状態検証や、戻せない操作への承認フローを設計に組み込むことが現実的な対策になります。モデル選定でも、単発の正答率ではなく反復での安定性と、信頼できるタスク1件あたりのコストを並べて見る必要があります。

気になる点

このベンチマークは自分で実行できますか
ブログではOpenEnv経由で実行できると説明されています。冒頭の例はsandbox_external_retail_group1.py:test_case_ST003_006として収録されており、失敗する実行可能チェックはチケットのstatusが本来holdであるべきところsolvedになっている1フィールドだと述べられています。詳細な手順は原文の「Run it yourself」節に譲られています。
示されているコストは実際の請求額ですか
いいえ。OpenRouter+で取得できる割引なしのリスト価格をもとにした推定で、比較用の効率指標と位置づけられています。実際のクラウド請求額ではなく、本番の1リクエストを処理する価格でもありません。入力・出力・キャッシュの料金は、モデルごとに1つのプロバイダエンドポイントから取得したと説明されています。
日本企業の既存システムにそのまま適用できますか
現時点では公表されていません。原文はOpenEnv経由での実行やMCPツールを使う評価の仕組みには触れていますが、日本語業務や日本企業の既存基盤への適用、既存の評価パイプラインとの統合方法については述べられていません。適用可否は今後の情報公開を待つ必要があります。

用語解説

MCP
Model Context Protocol。LLMアプリが外部ツールやデータソースに接続するための規格。本記事ではエージェントが操作する業務ツール群を指します。
pass@1
1回だけ試行したときの成功率の推定値。多くのリーダーボードが採用する指標で、本記事では反復での一貫性と対比されます。
実行可能チェック
最終的なバックエンド状態や副作用をコードで検証する判定。エージェントの自己申告ではなく、実際のデータを見ます。
パレートコストフロンティア
他のどのモデルよりも高コストでなく、かつ同等以上に高精度なモデルだけが残る集合。本記事では3モデルが該当します。
副作用
本来の目的以外に生じたデータ変更やレコード作成などの影響。追加の効果として検出されます。

出典

The Agent Said It Was Done. The Database Disagreed.

Hugging Face / 2026年10月4日

https://huggingface.co/blog/microsoft/thinkingbox

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する