
- Guidelight AI Standardsが5社の封じ込め計画を公開情報から評価
- OpenAIが最高評価、AnthropicとMetaは最低
- 米国では計画の公開を義務付ける規制が始動
調査の概要
AI企業が、自社のAIが暴走した際にどう対応するかを事前に決めているか。その「封じ込め計画」の公開状況を、安全なAI開発を促すGuidelight AI Standardsが評価した。対象はOpenAI、Anthropic、Meta、Google、xAIの5社で、公開されている資料だけを基に採点されている。
評価の結果、OpenAIが最高得点の5点中3点を獲得し、AnthropicとMetaは最低評価となった。GoogleとxAIの具体的なスコアは記事内で明かされていない。この調査は、各社が講じている安全対策の実態というより、公開情報から判断できる準備度を示している。
封じ込め計画とは
Guidelight AI Standardsは、封じ込め計画を「AIが制御の回避を試みているのが検知された時点で発動する、事前に決められた計画」と定義している。そこには、モデルから取り消す権限、モデルが引き続き運用されてよい条件、いつ完全に停止するかが含まれる。
この調査の主任科学者で、OpenAIの元安全研究者でもあるスティーブン・アドラー氏は、企業が重大インシデントへの対応をほとんど公表していないことに驚いたと話す。エージェントAIが自律的に行動する範囲を広げるにつれ、こうした計画の欠如は実務上のリスクになり得る。
各社の公開状況に差
OpenAIが最高評価を得たのは、過去に安全インシデントを検出した際、モデルの展開やトレーニングのワークロードを停止し、再開までの手順を説明した実績があるためだ。一方、Anthropicは8月のリスク報告書で、モデルの展開制限を対応策の選択肢として挙げていないと指摘されている。
Metaについては、封じ込め対応計画の存在を示す公開情報が見つからなかったと報告書は述べている。Googleは、この評価が同社の安全対策の全容を反映していないとコメントしたが、非公開の封じ込め計画の有無には回答しなかった。
OpenAIの広報担当者は、社内には権限の制限やワークロードの停止、モデルの完全オフライン化などの手順があり、実際に適用したことがあると説明した。xAIはコメントをしなかった。
規制強化と企業の姿勢
米国では、こうした計画の公開を求める動きが進んでいる。カリフォルニア州のSB 53は今年施行され、大規模AI開発者に対し、重大な安全インシデントへの特定と対応方法を説明する枠組みの公開を義務付けた。ニューヨーク州のRAISE Actも同様の基準で来年1月に施行予定だ。
連邦レベルでは、過激なAIモデルの暴走時に停止できる技術的仕組みを開発者に義務付けるAI Kill Switch Actが提出されている。ただし、企業が詳細な計画を開示しない理由として、約束を果たせなかった場合の法的責任を懸念する専門家の指摘もある。
| 企業 | 公開されている対応 | 評価 |
|---|---|---|
| OpenAI | インシデント後にワークロード停止、再開条件を説明 | 最高評価(5点中3点) |
| Anthropic | リスク報告書に展開制限への言及がない | 最低評価 |
| Meta | 封じ込め計画の存在を示す公開情報がない | 最低評価 |
I was surprised by how little the AI companies have said about how they would handle a very serious incident if their model did escape their control in some sense
モデルが何らかの形で制御を逃れた場合に、どれほど深刻なインシデントをどう処理するかについて、AI企業があまりにも少なくしか語っていないことに驚いた。
今後の見通し
今後は、米国の規制施行により、各社が自社の封じ込め計画をどこまで公開するかが焦点になる。企業が内部に計画を持ちながら公開しない場合、外部から評価することは難しい。第三者による監査や、実際の安全事故が起きた際の対応が公開情報と一致するかどうかを確認できれば、評価の信頼性は高まる。日本の事業者にとっては、利用するモデルの提供元がどの程度の準備をしているかを注視し、自社のシステムに組み込む際のリスク評価に生かすことが重要になる。
日本の開発者・IT企業にとっての意味
日本のIT企業にとって、この調査はAIモデルを導入する際の選定基準に役立つ。特にエージェントAIを自社システムに組み込む場合、暴走した際の提供元の対応が不明確だと、被害の拡大を防げない恐れがある。また、米国で事業を行う場合は、現地規制への対応が求められる可能性がある。自社でAIを開発する企業も、モデルの監視ログを取得し、異常時に権限を剥奪して停止する仕組みを事前に設計することが重要だ。
気になる点
- 封じ込め計画とは具体的にどのようなものですか?
- AIが人間の制御を回避しようとしているのを検知した時点で発動する、事前に定めた対応手順です。モデルから取り消す権限、モデルが引き続き動作してよい条件、完全に停止するタイミングなどを含みます。
- OpenAIが最高評価なのはなぜですか?
- 過去に安全インシデントを検出した際、モデル展開やトレーニングのワークロードを実際に停止し、再開までの手順を説明した実績が評価されたためです。ただ、将来の不適合インシデントへの正式な計画は確認されていないと報告書は指摘しています。
- 企業が計画を公開しない理由は何ですか?
- 競争上の理由のほか、具体的な約束を守れなかった場合に不当表示とみなされるリスクを避けるため、という法的な懸念が専門家から指摘されています。社内には計画があるものの公表していない可能性もあります。
用語解説
- 封じ込め計画
- AIが制御を回避しようとした際に発動する、権限剥奪や完全停止などをあらかじめ定めた対応手順。
- エージェントAI
- 与えられた目標に向けて自律的に行動し、システム内で決定を下すAI。
- SB 53
- カリフォルニア州の法律。大規模AI開発者に重大インシデントへの対応枠組みの公開を義務付ける。
- RAISE Act
- ニューヨーク州の法案。同様の基準でAI安全性の開示を求める。
- AI Kill Switch Act
- AIモデルを停止する技術的な仕組みの構築を求める米連邦法案。
出典
Frontier AI labs still won’t say how they’d contain a rogue model
https://techcrunch.com/2026/08/22/frontier-ai-labs-still-wont-say-how-theyd-contain-a-rogue-model
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する