
- AlphaGoの37手目を生んだのは直感ではなく、数千の枝を持つゲーム木の探索だった
- LLMのチェーン・オブ・ソートは同一の次トークン予測を長く繰り返すだけで、独立した推論機構ではない
- 筆者は明示的な認識状態を持ち、証拠に基づいて更新するAlphaGo型の推論設計を提唱
37手目は何だったのか
2016年3月、ソウルで行われた囲碁の対局で、筆者は自身が開発に関わったプログラムが第2局の37手目を打つのを見ました。この手は多くの解説者にとって不可解で、プログラムの不具合を疑う声もありました。しかしAlphaGoはその対局を制し、最終的に世界トップクラスの棋士である李世乭に4-1で勝利しました。李世乭は後に、AlphaGoを確率計算に基づく機械だと思っていたが、この手を見て考えが変わったと述べています。
筆者はこの手を「機械の直感」と説明する見方を誤解だとします。創造的な選択を可能にしたのはむしろAlphaGoの推論能力であり、現在のAIにはそれが欠けているというのが主張です。科学や医療で信頼できる結果と真に新しい知見を生むには、この種の推論能力が必要だと論じています。
AlphaGoの二つの仕組み
AlphaGoは二つのシステムからなります。一つ目のポリシーネットワークは、強い人間ならどの手を選ぶかを予測するよう訓練された「直感的」な部分で、37手目を特別な手とは見なしませんでした。熟練した人間が打つ確率はおよそ1万分の1と評価していたとされます。
37手目を選ばせたのは探索の仕組みでした。目先の妥当性を超えて候補手の将来の帰結を評価し、数千の枝を持つゲーム木を明示的に構築して探索したのです。行動科学では、速く直感的な「システム1」と、遅く段階的な「システム2」という二つの思考モードが知られています。AlphaGoはこの分業を機械で再現した例だと筆者は位置づけ、ネットワークが直感を、探索が熟慮を担い、どちらか一方だけでは37手目は選べなかったと説明します。
LLMの「熟慮」との違い
現在の大規模言語モデル(LLM)は、次のトークンを選ぶ処理を繰り返します。これはシステム1的な働きで、高速かつ連想的であり、人が書くほぼあらゆる主題についてパターンを補完することに長けています。
ChatGPTの登場後、言語の流暢さだけでは実用性に届かないことが認識され、問題を分解して中間ステップを生成するチェーン・オブ・ソートが導入されました。数学やコーディングでは実際に効果が確認されています。ただしAlphaGoの探索とは異なり、中間的な推論も同じ次トークン予測のプロセスが長く繰り返されるだけで、独立した推論機構が加わっているわけではないと筆者は指摘します。
推論と言えない三つの理由
筆者は、チャットボットの動作が科学者の言う推論に当たらない理由を三つ挙げます。第一に、モデルは明示的で永続的、かつ検査可能な認識状態を保持していません。検討中の仮説、説明ごとの確信度、吟味している証拠、未解決の問いを並べた台帳がなく、新情報に応じて体系的に更新されることもないという点です。
第二に、システムが何を知っているかと、その知識をどう操作するかが分離していません。知識と推論はニューラルネットワークの重みの中で不可分に混ざり合っており、独立して明示的に表現された信念の集合が存在しません。第三に、生成される思考の連鎖は熟慮のように見えても、実際には答えに到達した後に作られていることが研究で示されていると述べます。結論だけでなく結論への至り方が重要な医療や工学、科学研究では、この性質が問題になると指摘します。
提唱される新たな設計
筆者は最近Google DeepMindを離れました。AlphaGoのアーキテクチャに学ぶ、機械推論への新しいアプローチが必要だと考えたためです。AlphaGoはゲーム木という形で、ある局面について何を知っているかの記録を保ちます。検討した変化のそれぞれにニューラルネットワークの判断が付され、推論が進むにつれて更新され、最終的に統合されて次の一手が決まります。
汎用的な推論でも同様に、確定した事柄、疑っている事柄、排除した選択肢、未解決の問いを表す認識状態を維持すべきだと筆者は提案します。推論は、その状態を変えて知識を進め不確実性を減らす一連の操作として捉えられます。次にどの問いを立て、どの計算を行い、どの実験をするかを決めることも含まれます。LLMは既知の情報と利用可能な資源に基づいて問題への取り組み方を提案し、APIやコードを通じてツールとやり取りできるため、こうした一般的な推論に挑む能力が備わってきたと述べています。
もっとも、現実世界の推論は囲碁やチェスより難しいとされます。現状は部分的にしか分からず、取り得る行動の集合は広く可変で、行動の結果は確率的または未知です。加えて、システムを誠実に保つためには、各操作が実際にどれだけ不確実性を減らしたかを独立した部分が評価し、証拠に裏付けられたときだけ信念を更新する仕組みが必要だとしています。
| 項目 | AlphaGo | 現在のLLM |
|---|---|---|
| 推論の担い手 | 探索がゲーム木を明示的に構築 | 同じ次トークン予測を繰り返す |
| 知識と推論の関係 | ネットワークの判断と探索を分離 | 重みの中で不可分に混ざる |
| 検討過程の記録 | ゲーム木として保持・更新 | 検査可能な形では保持しない |
I do not think we reach trustworthy machine intelligence by making system 1 bigger. Scale sharpens intuition, but it does not make intuition more deliberative.
システム1を大きくすることで信頼できる機械知能に到達するとは思わない。規模は直感を鋭くするが、直感をより熟慮的にするわけではない。
今後の見通し
筆者はAlphaGo型のアーキテクチャを提唱していますが、具体的な実装や評価結果はこの寄稿では示されていません。今後、明示的な認識状態を維持する仕組みが実際のLLMでどこまで機能するのか、ベンチマークや実応用での検証が待たれるところです。筆者は「システム1を大きくする」ことでは信頼できる機械知能に到達しないと述べ、薬剤探索や材料、気候、診断といった分野での応用を想定しています。これらの分野で監査可能な推論がどう評価されるかが明らかになれば、実務での採用判断ができるとみられます。
日本の開発者・IT企業にとっての意味
日本企業がLLMを業務システムに組み込む際、判断根拠の「説明責任」をどう設計するかという論点に関わります。金融、医療、製造の品質管理など、判断の監査が求められる領域では、出力の正しさだけでなく結論への至り方の追跡可能性が必要になります。思考の連鎖を画面に表示するだけでは監査に耐えない可能性があることを、この指摘は示唆しています。実務では、推論過程をアプリケーション側で外部に記録する仕組みを持つこと、証拠に紐づけて検証すること、不確実性を明示することが検討課題になります。AlphaGo型の探索的アプローチはエージェント設計の方向性として参考になりますが、実装は示されていないため、当面は既存LLMの限界を前提とした設計が現実的とみられます。
気になる点
- チェーン・オブ・ソートには効果がないということか
- そうではありません。原文は数学やコーディングで実際に成果が確認されたとしています。問題は、それが独立した推論機構ではなく、同じ次トークン予測を長く繰り返すだけの点にあります。さらに、思考の連鎖が答えを出した後に作られている場合があることも研究で示されていると筆者は指摘しています。
- AlphaGo型の推論を自社のシステムに導入できるのか
- 現時点では公表されていません。原文では認識状態の維持、証拠に基づく信念の更新、独立した評価といった設計の方向性が示されるにとどまり、実装方法や利用可能なツール、費用には触れていません。具体的な実装や検証結果が示されるかを待つ必要があります。
- なぜ筆者はGoogle DeepMindを離れたのか
- 原文では、機械推論にはAlphaGoのアーキテクチャに学ぶ新しいアプローチが必要だと考えたためと説明されています。筆者はAlphaGoチームの核心メンバーだったと述べており、現在はUniversity College Londonで機械学習の講座を担当していると記されています。
用語解説
- ポリシーネットワーク
- 囲碁などで次に打つ手を予測するニューラルネットワーク。AlphaGoでは「直感」を担う部分として説明されている。
- チェーン・オブ・ソート
- LLMが答えを出す前に中間的な推論ステップを生成する手法。問題を分解し、部分的な結果を引き継ぐ。
- システム1とシステム2
- 行動科学で知られる二つの思考モード。システム1は速く直感的、システム2は遅く段階的で熟慮的とされる。
- ゲーム木
- 対局の変化を枝分かれした木構造で表したもの。AlphaGoはこれを構築・更新して先の展開を探索した。
- 認識状態(epistemic state)
- 確定した事柄や疑い、排除した選択肢、未解決の問いを表す状態。筆者はこれを明示的に保持すべきだと論じる。
出典
Don’t be fooled—LLMs don’t reason
https://technologyreview.com/2026/10/02/1145639/dont-be-fooled-llms-dont-reason
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する