
- Anthropicが約2億件のやり取りを蒸留攻撃と特定し、5つのキャンペーンに帰属
- 最大規模はAlibaba系で2026年5〜7月に1億5,100万件、1日最大約300万件
- Moonshot AI系は中国軍発とみられる経路、10日間で約30万件を確認
何が報告されたのか
Anthropicは2026年9月10日、中国を拠点とするAI企業による蒸留攻撃に関する報告書を公表しました。報告書によれば、同社は蒸留攻撃に関連する約2億件のやり取りを確認し、それらを5つの異なるキャンペーンに帰属させています。標的とされたのは、Claudeのエージェント機能やツール利用、コーディングとデータ分析、論理的推論といった能力だと説明されています。
Anthropicが蒸留攻撃について公に言及したのは今回が初めてではありません。記事によれば、同社は2月にも特定のラボを名指しして警告していました。OpenAIも同様の活動を報告しており、こちらは特にDeepSeekによるものとしています。今回の報告で示されたキャンペーンは、規模と攻撃性の両面で従来より大きいと記事は伝えています。
蒸留攻撃の仕組みとは
蒸留攻撃は、モデルが各種の問い合わせに対して返す「思考の連鎖(チェーン・オブ・ソート)」を抽出することが中心になります。抽出した思考の連鎖を教師ありファインチューニングに使えば、より小さいモデルに汎用的な推論能力を学習させられるとされています。
Anthropicは通常、モデルの内部的な思考の連鎖をそのままユーザーに公開せず、概要を示す「要約された思考」のブロックを表示します。しかし攻撃側は、モデルに思考の痕跡を直接明かさせる特定の手法を見つけ出したと報告書は述べています。記事では、ある攻撃者が翻訳リクエストに見せかけた質問で標的モデルを欺いた例が挙げられています。
最大規模はAlibaba系
Anthropicが観測した中で最大の包括的な蒸留の取り組みは、Alibabaに帰属されるキャンペーンでした。2026年5月から7月にかけて1億5,100万件のやり取りが確認され、1日あたりでは最大で約300万件に達したとされています。
やり取りは3,500の異なるアカウントに分散していましたが、思考の連鎖を引き出すために使われた単一の固定プロンプトを共有していたため、AnthropicはAlibabaのQwenファミリー向けの訓練データ作成を目的とした単一の活動と判断しました。同社がこれまでに観測した中で最大の包括的な蒸留の試みだと説明されています。
中国軍からとみられる経路も
Kimiを手がけるMoonshot AIに帰属される別のキャンペーンでは、リクエストが中国軍から直接ルーティングされたように見えたと報告書は述べています。あるリクエストは、録画された監視カメラ映像の山をClaudeに評価させ、対象者が「異常な行動」をとっているかを判定させるものだったといいます。
10日間の1つの期間に、5,000のアカウント網を通じて約30万件のリクエストがClaudeに送られ、主にOpusモデルが標的になったとAnthropicは説明しています。
まだ分かっていないこと
この報告書はAnthropic自身による調査結果であり、記事の時点で第三者機関による検証が行われたかどうかは示されていません。名指しされた各社が内容を認めたのか、反論したのかについても記事には記載がありません。
Anthropicが技術的な対策をどこまで強化したのか、法的措置を検討しているのかも記事からは読み取れません。攻撃手法の詳細がどの程度公開されるかも不明で、防御側の各社が同じ情報を共有できるかどうかは今後の論点になるとみられます。
| 項目 | Alibabaに帰属 | Moonshot AIに帰属 |
|---|---|---|
| 確認されたやり取り数 | 1億5,100万件 | 約30万件 |
| 観測された期間 | 2026年5月〜7月 | 10日間の1期間 |
| 関与したアカウント数 | 3,500 | 5,000 |
| 帰属の手がかり | 共通の単一固定プロンプト、Qwen向け訓練データ作成 | 中国軍から直接ルーティングされたとみられる経路 |
Over the last several months, unauthorized labs have developed increasingly sophisticated methods to circumvent our defenses and harvest the capabilities of US frontier models.
ここ数カ月で、無許可のラボは当社の防御を回避し、米国のフロンティアモデルの能力を収穫するための、ますます洗練された手法を開発してきた。
今後の見通し
現時点で公表されているのはAnthropic側の調査結果であり、名指しされた各社の反応や第三者の検証結果は明らかになっていません。今後、Anthropicが防御手法の詳細や追加の対策を公表すれば、API提供各社がどこまで同じ防御を採用できるかが見えてくるとみられます。また、蒸留攻撃をめぐる法的・契約上の扱いが整理されれば、モデルの出力をどのように監視し、利用規約でどう制限するかの判断材料になるでしょう。日本企業が自社モデルを開発する場合も、学習データの出所をどう説明するかが論点になり得ます。
日本の開発者・IT企業にとっての意味
API経由でモデルを提供する企業にとって、出力の監視や異常な利用パターンの検知、思考過程をどこまで見せるかの設計が、品質だけでなく防御のコストとして意識される状況になりつつあります。今回狙われたのがエージェント機能やツール利用、コーディングだった点は、日本企業が業務システムにエージェントを組み込む際に無視できません。自社の業務データやプロンプトが外部モデルの学習に使われないか、契約と利用規約で確認する必要が高まります。一方で、国内でモデルを開発する企業は、学習データの由来を説明できる体制を整えておくことが、顧客からの信頼を得る条件になるとみられます。
気になる点
- Anthropic以外のモデル提供元でも同じ問題は起きていますか
- 記事によれば、OpenAIも同様の活動を報告しており、特にDeepSeekによるものとしています。ただし、他の提供元が同規模の被害や対策を公表しているかについては、この記事では触れられていません。
- 自分のAPIアカウントが蒸留攻撃に関与したと判定される基準は分かりますか
- 記事には個々のアカウントをどう判定したかの詳細は示されていません。Anthropicは共通の固定プロンプトの共有ややり取りの量などから帰属を判断したとされますが、利用者向けの確認手段や通知の有無は公表されていません。
- 日本企業が自社モデルを開発する場合、この問題は関係しますか
- 蒸留は公開モデルの出力を学習データとして使う行為全般に関わるため、学習データの出所管理は論点になり得ます。ただし今回の報告は特定の中国企業のキャンペーンに関するもので、日本の事業者への影響は記事では言及されていません。
用語解説
- 蒸留攻撃
- あるモデルの出力、特に思考過程を取り出し、それを学習データとして別の小型モデルに能力を移植する行為。
- チェーン・オブ・ソート(CoT)
- モデルが最終回答に至るまでの推論過程を言語化したもの。抽出されると推論能力の学習に使われ得る。
- 教師ありファインチューニング
- 入力と正解の組を大量に与えてモデルを追加学習させる手法。蒸留では抽出した出力を正解として使う。
- エージェント機能
- モデルが外部ツールを呼び出したり、複数手順の作業を自律的に進めたりする能力。
出典
Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
AI導入も顧問も、お任せください
何から手をつけるか、どこまでAIに任せるか。自社の業務に合わせて整理し、導入から運用まで伴走します。相談だけでも構いません。
AI導入について相談する