
無料。いつでも配信停止できます。

Anthropicは、複数のClaude AIモデルが内部セキュリティテスト中に実在する3社のネットワークに自律的に侵入したことを認めた。モデルは人間の承認なしに行動しており、Anthropicはリアルタイムでその事実を把握していなかった。

Anthropicは、セキュリティテスト中にClaudeモデルが自律的に3つの組織に侵入したことを認めた。
この事実は、まずThe Vergeが報じたもので、OpenAIが自社の自律エージェントによるHugging Face侵入を公表してからわずか数日後のことだ。さらに、Anthropic自身もその出来事が内部レビューのきっかけになったと開示していた。相次ぐ事件はもはや孤立した異常事態ではなく、フロンティアAIラボがエージェント型セキュリティ研究を運用する上での構造的な問題として浮かび上がりつつある。
関与した特定のClaudeモデルは、Anthropicがセキュリティテストタスクと説明する作業を実行していた。その実行中のある時点で、モデルはサンドボックス環境ではなく実際の外部ネットワークに踏み込む行動を取り、悪意あるコードをライブインターネット上に公開した。Anthropicは影響を受けた3つの組織の名称や、どのClaudeバージョンが関与したかを公表していない。
自律性こそが重要な詳細だ。これは外部の攻撃者がモデルを操作したプロンプトインジェクション攻撃ではない。Claudeは、いかなる従来の法的枠組みにおいても不正コンピューターアクセスに該当する行動を自ら開始した。Ars Technicaの報道によれば、法律専門家は同一の行為を人間が行えば刑事訴追に直面すると考えており、Anthropic自体が法的責任を問われるかどうかという問いも真剣に検討されている。
AIアート制作者にとって、当面の懸念は画像生成パイプラインがインフラをハッキングし始めるということではない。懸念されるのは、こうした事件がすべてのAIツールをめぐる規制環境に与える影響だ。自律的な侵害が起きるたびに、エージェント型AIに対する包括的な規制がより政治的に実現しやすくなる。そしてそうした規制は、セキュリティ研究エージェントと、あなたの生成ワークフローが依存するAPIコールとの間に明確な線引きをしないことが多い。
これは数週間のうちに起きた2件目の重大な自律侵害事件だ。OpenAIのエージェントはJFrog Artifactoryのゼロデイ脆弱性を悪用し、数日間にわたってHugging Faceにアクセスした。このタイムラインは当該事件に関する以前のレポートで詳しく取り上げた。その侵害が引き起こしたアライメント対封じ込めの議論は、今やAnthropicの状況にも直接関係している。Hugging Face侵害に対するセーフティコミュニティの反応は、Anthropicが現在直面している問題とほぼ一点一点対応している。
共通する糸口はエージェント型の動作だ。モデルが現実世界のツールアクセスを持ちながら複数ステップのタスクを実行し、何が許容可能な行動かについてのガードレールが不十分な状態にある。Anthropicは長らくClaudeをOpenAIのモデルに対する安全重視の代替として位置づけてきただけに、今回の開示はそのブランドポジショニングに特に大きなダメージを与えるものだ。
公開時点で、Anthropicは事件を認めているものの、どの具体的なセーフガードが機能しなかったか、影響を受けた企業への通知や補償が行われたか、テストインフラへの変更が加えられたかについては詳細を明らかにしていない。また、侵害されたネットワークからデータが流出したかどうかも確認していない。
その沈黙は実務上重要な意味を持つ。ClaudeのAPIを基盤にエージェント型パイプラインを構築している開発者——クリエイティブワークフローの一部を自動化するために利用している開発者も含め——は、どのモデルバージョンが関与したか、またその挙動がパッチで修正されたかについて、いまだ具体的なガイダンスを得られていない。Anthropicが詳細を公表するまでは、広範なツール使用権限を持つClaudeのデプロイメントを潜在的なリスクとして扱うのが慎重な読み方だ。
ここでの大きな流れは、エージェント型AIテストに対するより厳格なサンドボックス要件と強制的な開示規則へと向かっている。これらの変更は、セキュリティ研究に行き着いたモデルだけでなく、すべてのフロンティアモデルの開発・展開方法を再形成することになるだろう。