この記事について海外で公開された情報をもとにAIが要約・解説した記事です。原文の翻訳ではありません。正確な内容は記事末尾の出典元をご確認ください。
この記事の要点
  • GLM-5.3は100タスク中4%で完全な制御フローハイジャックを成立させた
  • Claude Mythos Previewは6%で成功し、GLM-5.3を上回った
  • Claude Opus 4.6とGLM-5.2は1件も成功せず、閾値を超えたとAnthropicは評価

何が報告されたのか

AnthropicのFrontier Red Teamが、AIモデルのサイバー能力に関する分析を公表しました。Simon Willison氏が2026年9月29日の投稿で、その一部を引用として紹介しています。評価の対象は、同チームが社内で運用するBinary Exploitationベンチマークからランダムに選んだ100タスクです。複数のモデルをこのタスクで走らせ、完全な制御フローハイジャックを成立させられた割合を測っています。

結果として示されたのは、GLM-5.3が試行のうち4%で制御フローハイジャックを成立させたという数字です。Claude Mythos Previewはこれを上回る6%でした。一方、Claude Opus 4.6やGLM-5.2といった以前のモデルは、いずれのタスクでも成功していないとされています。Red Teamは、GLM-5.3がClaude Mythos Previewを下回ることを認めつつ、意味のある閾値が明らかに超えられたと述べています。

制御フローハイジャックとは

制御フローハイジャックとは、プログラムの実行の流れを攻撃者の意図する方向に書き換える手法を指します。一般にはメモリ破壊の脆弱性を突き、リターンアドレスなどを差し替えて意図しないコードを動かすところまでを伴います。攻撃者にとっては最終目的に近い工程であり、ここまで到達できるかどうかが悪用の成否を分けます。

この工程をAIモデルが自動で成立させられるかは、脆弱性の発見だけでなく悪用コードの生成までをモデルが担えるかという問題です。4%や6%という成功率は決して高い数字ではありません。ただし従来モデルが0%だったという報告と並べると、能力の質的な変化を示す数字として読むことができます。原文では、この変化を「閾値」という言葉で表現しています。

既存モデルとの比較

同じベンチマーク上での結果を並べると、モデル間の差がはっきりします。GLM-5.3の4%、Claude Mythos Previewの6%に対し、Claude Opus 4.6とGLM-5.2は成功ゼロでした。100タスク中4%という比率は、単純にいえば数件のタスクで成立したことを意味します。

ただし、この比較は同一の評価条件が保たれていることを前提としています。タスクの難易度や分野の内訳、試行回数、採点の判定基準は原文に示されていません。数字だけを並べて他モデルの能力と直接比べる際には、この点を留意する必要があります。

未公開の評価と注意点

ベンチマークは「internal」、つまり社内のものとされており、タスクの内容や評価手順は公開されていません。第三者が同じ結果を再現できるかは、現時点では分かりません。Willison氏の投稿もこの引用を紹介する短いもので、追加の分析や検証は含まれていません。

モデルの提供元や公開時期、利用条件についても、原文には記述がありません。サイバー能力の評価は、脆弱性の修正に使う防御的な用途と、悪用に使う攻撃的な用途の両方に関わります。数値の重みづけを判断するには、評価の詳細が公表されるのを待つ必要があると考えられます。

同一ベンチマーク100タスクでの制御フローハイジャック成功率
モデル制御フローハイジャック成功率
GLM-5.34%(100タスク中)
Claude Mythos Preview6%(100タスク中)
Claude Opus 4.6成功なし
GLM-5.2成功なし
原文からの引用
Although GLM-5.3 performs below Claude Mythos Preview here, a meaningful threshold has clearly been crossed: earlier models, like Claude Opus 4.6 and GLM-5.2, do not succeed in any of them.

GLM-5.3はここではClaude Mythos Previewを下回るが、意味のある閾値が明らかに超えられた。Claude Opus 4.6やGLM-5.2といった以前のモデルは、そのいずれでも成功していない。

今後の見通し

今後注目されるのは、この評価の詳細が公開されるかどうかです。ベンチマークのタスク内容や採点基準、実行環境が明らかになれば、4%や6%という数値の意味を第三者が検証できるようになります。あわせて、他の研究機関やモデル提供元が同種の評価を再現し、同じ傾向が確認されるかも判断材料になるとみられます。GLM-5.3の次の世代や他社モデルで成功率がどう変化するかは、AIのサイバー能力が実務上のリスクとして扱うべき水準に達しているかを測る指標になると考えられます。

日本の開発者・IT企業にとっての意味

バイナリの悪用コード生成は、これまで人間の熟練したセキュリティ研究者が担ってきた領域です。モデルが制御フローハイジャックを一定の確率で成立させるようになったという報告は、脆弱性の発見から悪用までの工程が部分的に自動化されうることを示唆します。日本のIT企業にとっては、自社製品の脆弱性診断やパッチ適用の優先度判断といった防御側の業務に、AIの能力向上を織り込む必要が出てくる可能性があります。同時に、この評価はAnthropicの社内ベンチマークに基づくもので、再現性や一般性はまだ確認できません。自社環境への影響を判断するには、公開情報が増えるのを待ちつつ、モデル利用ポリシーや脆弱性対応プロセスの見直しを進めておくことが現実的と考えられます。

気になる点

このベンチマークは公開されていますか?
原文では「internal Binary Exploitation benchmark(社内ベンチマーク)」とされており、タスクの内容や採点方法は公開されていません。第三者が同じ条件で再現できるかは現時点では不明です。評価の詳細が公表されれば、数値の重みづけを判断できるようになるとみられます。
GLM-5.3はどのように入手・利用できますか?
原文にはモデルの提供元や公開時期、ライセンス、API提供の有無といった情報は含まれていません。AnthropicのRed Teamの分析はサイバー能力の評価に焦点を当てたもので、モデルの利用方法には触れられていません。正確な情報は今後の発表を確認する必要があります。
4%という成功率は実務上の脅威になりますか?
原文は「意味のある閾値が明らかに超えられた」と評価しているだけで、具体的な悪用シナリオや影響範囲には触れていません。4%や6%は単発では低い数字ですが、従来モデルが0%だったことからの変化として捉えられています。実務判断にはタスク内容や再現性の情報が追加で必要とみられます。

用語解説

制御フローハイジャック
プログラムの実行の流れを攻撃者の意図する方向に書き換えること。メモリ破壊の脆弱性を突き、意図しないコードを実行させる手法を指す。
Binary Exploitation
バイナリ(実行ファイル)の脆弱性を突いて、プログラムの挙動を攻撃者が制御する技術領域。ベンチマーク名としても使われている。
Red Team
組織の中で攻撃者側の立場に立って防御策を検証するチーム。ここではAnthropicのFrontier Red Teamを指す。
ベンチマーク
モデルの能力を同一条件で比較するための評価用タスク群。結果の解釈にはタスクの内容や採点方法の公開が重要になる。

出典

Quoting Anthropic Frontier Red Team

Simon Willison / Simon Willison / 2026年9月30日

https://simonwillison.net/2026/Sep/29/anthropic-frontier-red-team

AI導入も顧問も、お任せください

何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。

AI導入について相談する