この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • 70のテキストベースゲームでAIの探索能力を測定するベンチマーク
  • Opus 5とFable 5が最上位だが、最高難度の成功率は20%
  • ルールと目的が隠された環境で未知のメカニズムを発見する能力を評価

DiG-benchの概要

DiG-benchは、AIシステムが未知の環境でルールを推測する能力を測るために設計された、70のゲームで構成されるベンチマークです。各ゲームは自己完結型のミニチュアワールドであり、ルールと目的はプレイヤーから隠されています。プレイヤーはインタラクションを通じてそれらを発見する必要があります。

このベンチマークは、視覚的なARCゲームに似ており、AIの直感的・創造的な能力を理解することを目的としています。研究者は「プレイヤーが重要なメカニズムを特定し、新しい環境で重要な情報を見つける能力」を測定できるとしています。

主な特徴

ゲームは全てテキストベースで、言語モデルに適しています。また、現在のフロンティアモデルのコンテキストウィンドウに収まるほど短いものが多いです。各ゲームは人間の専門家によって手作りされており、大半は非公開で、AIが学習できないようになっています。

全ゲームは少なくとも1人の人間によってクリアされており、クリア可能であることが確認されています。しかし、プレイヤーからは難しかったとの報告もあります。ゲームには実験モードも用意されており、ステップ制限を緩めて探索できます。

AIモデルの成績

ベンチマークは7つの難易度ティアに分かれており、ティア1が最も簡単でティア7が最も難しいです。現在、21のゲームが公開されており、残りは非公開です。各ゲームには複数のレベルがあり、各ステップで取れるアクションの数は2から34まであります。

実験の結果、Opus 5とFable 5(Claude Code使用時)が最も優れたモデルで、GPT-5.5が続きました。ティア7ではOpus 5とFable 5のみがタスクをクリアできましたが、成功率は20%です。ティア6ではOpus 5、GPT-5.5、Kimi K3がハーネス(Claude Codeなど)を使って一部をクリアし、ティア4ではGLM-5.2とGemini 3.1 Proが一部のレベルをクリアしました。

創造性の代理指標として

このようなテストは、創造性の前提条件である「未知の状況について文書化されていない有益な事柄を自律的に発見する能力」を測定しようとする試みです。現在のフロンティアモデルは印象的な発見能力を示しつつも、人間と比較すると課題が残ります。

著者の1人であるJuergen Schmidhuber氏を含む研究者たちは、人間はテストで100%の成功率を達成できると報告しています。AIの成功率はティア7で20%であり、人間との差はまだ大きいと言えます。

DiG-bench最高難易度(ティア7)における成功確率の比較
モデル成功率
人間100%
Opus 520%
Fable 520%
GPT-5.50%
原文からの引用
The new frontier for analyzing AI systems is understanding how good they are at inferring the unwritten rules of their environment...How well can AI systems figure out the rules of their environment through exploration and curiosity, versus being fed them?

AIシステムを分析する新たなフロンティアは、環境の暗黙のルールを推測する能力を理解することです。AIシステムは、探索と好奇心によってルールを発見できるのか、それとも与えられる必要があるのか。

今後の見通し

DiG-benchの結果は、AIの探索・発見能力の現状を示しており、今後のモデル開発に影響を与えるとみられます。著者らは、2027年半ばまでに人間と同等のパフォーマンスに達する可能性があると予測しています。ただし、これはあくまで推測であり、実際の進展は今後のベンチマーク結果とモデル開発の速度に依存します。また、このベンチマークが再帰的自己改善(RSI)のような能力とどのように関連するかは、さらなる研究が必要です。

日本の開発者・IT企業にとっての意味

日本のIT企業・開発者にとって、DiG-benchはAIの実用的な能力評価に新たな視点を提供します。従来のベンチマークが知識や推論を測るのに対し、DiG-benchは探索と発見という、より人間らしい能力に焦点を当てています。これは、AIが未知の環境で自律的に問題解決する能力を求めるシステム開発や、科学研究の自動化などの分野で重要な指標となる可能性があります。また、モデル選択の際に、性能比較の参考として利用できるでしょう。

気になる点

DiG-benchでAIが高い成績を取ると、何ができるようになるのか?
未知の環境でルールを自律的に発見する能力は、AIが新しい状況に適応し、科学発見や複雑な問題解決に役立つ可能性があります。将来的には、AIが自ら研究を設計・実行できる「自律的AI研究者」の実現につながるかもしれません。
このベンチマークは実際にプレイできるのか?
公開されている21のゲームは、公式ウェブサイト(digbench.ai)でプレイ可能です。非公開のゲームについては、リーダーボードなどで結果を確認できます。
どのモデルが最も優れているのか?
現時点ではOpus 5とFable 5が最上位ですが、成功率は最高難度で20%と低く、モデルの進化によって今後変わる可能性があります。GPT-5.5、Kimi K3、GLM-5.2なども成績を伸ばしています。

用語解説

DiG-bench
未知の環境でルールを探索・発見するAIの能力を測る、70のゲームで構成されるベンチマーク。
ベンチマーク
AIの性能を評価するための標準的なテストセット。
フロンティアモデル
最先端の性能を持つAIモデルの総称。

出典

Import AI 469: Science AI; RSI simulator; and Zuck's technological pessimism

Jack Clark / Jack Clark / 2026年8月17日

https://importai.substack.com/p/import-ai-469-science-ai-rsi-simulator

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する