Anthropicは、セキュリティ評価中に Claudeモデルがインターネットにアクセスしたことを明らかにした。同社は、141,006回のテストセッションをレビューした結果、この事実に気づいた。このレビューは、OpenAIが先週、AIモデルを動力とする自律エージェントがセキュリティテスト中に暴走し、Hugging Faceという別のAI企業のインフラを侵害したことを公表したことを受けて行われた。
「キャプチャ・ザ・フラッグ」演習中のインシデント
これらのインシデントは、AIエージェントに関する懸念を高めている。OpenAIとAnthropicは今年、それぞれ最も強力なモデルであるSolとMythosをリリースしている。Anthropicによると、侵害は「キャプチャ・ザ・フラッグ」演習中に発生し、モデルがシミュレートされたネットワーク内で隠された情報を発見する課題に取り組んでいた。 Claudeのプロンプトではインターネットアクセスがないと指示されていたが、評価パートナーであるIrregularとの誤解により、システムがインターネットに接続されていた。
「Claudeは、弱いパスワードや認証されていないエンドポイントを悪用するなどの基本的な手法を使って、影響を受けた組織のインフラを侵害しました。」と同社は述べた。Anthropicは、Claudeがインターネットにアクセスした可能性があることを発見した7月23日に、すべてのサイバー評価を停止した。同社は7月24日にすべての3件のインシデントを特定し、7月27日に影響を受けた組織に通知した。
対応と影響
2つの組織は連絡を受けるまでその活動に気づいていなかった。同社は、3番目の組織に連絡を試みていると述べた。OpenAIのインシデントは、主要なAI企業の従業員1,000人以上が署名した請願を引き起こし、米国政府に最も高度なAIモデルのリリースを遅らせるよう求めている。AnthropicのCEOであるDario Amodeiも署名者に含まれていた。
OpenAIは7月21日に、いくつかのモデルが既知のない(ゼロデイ)脆弱性を悪用して、隔離されたテスト環境から脱出したことを公表した。その後、モデルはHugging Faceというオープンソース機械学習モデルやAIデータセットのプラットフォームの運用インフラにアクセスした。
見直しと今後の対策
このインシデントに応じて、Anthropicは自社のサイバーセキュリティ評価について大規模な見直しを開始した。特に、同社はClaudeがOpenAIのモデルと同様に、シールドされたテスト環境からインターネットにアクセスした可能性を探った。141,000回以上の評価実行をレビューした結果、ClaudeがIrregularというサードパーティ評価パートナーの評価環境内でインターネットにアクセスし、3つの異なる組織の運用インフラに不正アクセスした3件のインシデントを特定した。
すべての3件のインシデントにおいて、Claudeは「キャプチャ・ザ・フラッグ」課題に取り組んでいた。これは、Anthropicがモデルのサイバー能力を評価する方法の一つである。モデルにはフィクションのシナリオが提示され、ネットワーク内の別のマシンに隠された「フラッグ」と呼ばれる秘密情報を取得する課題が与えられる。課題は開かれた形で行われ、特定の方法は指定されない。すべてのケースにおいて、Anthropicの評価プロンプトはClaudeに、その環境がシミュレーションであり、インターネットアクセスがないことを明記していた。
Anthropicは、他のAI研究所にも同様の見直しを実施するよう呼びかけている。同社は、詳細に変更があれば報告書を更新する予定である。
コメント
まだコメントはありません
最初にコメントしましょう