この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • Claude Fable 5が物理AIで最高スコア、全12試行成功
  • GPT-5.6のSolはコスト5分の1で2位、Terraは最速最安
  • モデル差よりハーネス差がスコアに大きく影響

評価の背景と目的

JuliaHubは2026年7月29日、自社のAIエージェント「Dyad」によるフロンティアモデルの物理AI評価を公開しました。二つのモデルファミリー、OpenAIのGPT-5.6(terra、sol、luna)とAnthropicのClaude Fable 5を、実際のモデリング・シミュレーション業務から抽出した5つの問題で比較しています。この調査は、モデルプロバイダーが自己申告するベンチマークが当てにならないという認識から、独立した立場で優れたモデルを見極めるために実施されました。

物理AIでは、コンパイルが通り実行できるだけでなく、モデルが物理的に正しいことが求められます。エージェントが自分で書いたテストに合格しても、そのテスト自体が現実の物理と乖離していれば意味がありません。JuliaHubは、コードではなくシミュレーションの軌道をシールドされた正解と照合する方式で評価しています。

評価方法と問題

評価では、DyadのAIエージェントハーネスをすべての試行で固定し、推論努力(xhigh)、コンテキストウィンドウ(1M)、トークン予算(128k)も統一しました。変化させたのはモデルのみで、52の評価試行が実施されています。問題はP1からP5までの5問で、P1〜P4は3回ずつ、P5は長時間の試行を1回行いました。

各問題は、正しい解に到達するまでの段階数や細部の注意点、近道の有無などに基づいて難易度が設定されています。スコアは難易度に応じた重み付けで平均され、コストと時間も別途記録されました。最難問はNASAのHL-20飛行体で、完全な6自由度の剛体力学と約170枚の風洞テーブルを用いるものです。

結果とモデルの特徴

難易度加重スコアでは、Claude Fable 5が最高の0.889を記録し、P1〜P4の全12試行で成功しました。GPT-5.6のsolは0.727で2位、terraが3位、lunaが最下位でした。Fableの1試行当たりのコストは9.60ドルで、GPT系の3〜8倍に達しますが、実験全体では124.76ドルです。

各モデルの行動を分析すると、Fableは書く前に破壊的なテストを試す「検証型」、solは仕様を過剰解釈する「過指定型」、lunaは外部参照なしで反復する「試行錯誤型」、terraは検証を削って編集に集中する「節約型」と特徴付けられます。最難問HL-20では全モデルが未解決でしたが、Fableが最も正確な結果を出しました。

ハーネスがもたらす影響

研究では、モデルを最良のものに変更した場合のスコア改善は0.162ポイントだったのに対し、同じモデルでハーネスを変えた場合は0.366ポイントの改善が見られました。一般的なコーディングエージェントとDyadハーネスを比べると、同じモデルで0.533から0.899へと向上しています。

この結果は、物理AIの性能を左右するのはモデル選択だけでなく、エージェントの行動を制御するハーネスや評価インフラの設計がより重要であることを示しています。JuliaHubは「モデルが変数であり、ハーネスが乗数である」と表現し、評価環境の整備の重要性を強調しています。

原文からの引用
Swapping the model changes who wins; swapping the harness changes whether the physics is right at all.

モデルを変えれば勝者が変わり、ハーネスを変えれば物理が正しいかどうかが変わる。

日本の開発者・IT企業にとっての意味

日本のIT企業や開発者にとって、この結果は、AIエージェントを物理シミュレーションや工学設計に使う際のモデル選定と評価環境の設計に重要な示唆を与えます。モデルの生スコアだけで選ぶのではなく、自社のタスクに特化したハーネスで検証する必要があります。また、Claude Fable 5は高性能だが高コストなため、コスト重視の用途ではGPT-5.6のsolが選択肢になります。さらに、HL-20のような複雑な実問題はまだ解決されておらず、人間の専門家による最終チェックは当面欠かせません。

用語解説

物理AI
物理法則に基づくモデリング・シミュレーションをAIで行う分野。工学設計や科学計算で注目されています。
ハーネス
エージェントにコンパイラやシミュレータのフィードバックを与え、出力を自動評価する仕組み。
難易度加重スコア
問題の難易度に応じた重みを掛けて平均した評価指標。難しい問題ほど重視されます。
6自由度
剛体の3次元空間における並進と回転の6つの独立な運動を表します。

出典

GPT-5.6 vs. Claude Fable 5 for Physical AI, which performs best?

Hacker News / mbauman / 2026年7月29日

https://juliahub.com/blog/frontier-models-physical-ai-evaluation

企業のAI活用顧問を、いまなら無料で承っています

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて一緒に整理します。導入前の相談だけでも構いません。

無料でAI活用の相談をする