AIアシスタントFiuはClaude Opus 4.6を使用して6,000回のハッキング試行に耐えた
開発者フェルナンド・イララサバルは2026年2月にhackmyclaw.comを立ち上げ、AIアシスタントのFiuを騙してsecrets.env認証情報ファイルを漏洩させるというチャレンジを開始した。 この実験は、その投稿がHacker Newsでトップに躍り出た後、2,000人以上の攻撃者から6,000件以上のハッキング試行を集めた。 このテストは、通常のメール内に悪意のあるコマンドを隠すプロンプトインジェクションを標的にしており、OpenAIは2025年12月に「完全に解決される可能性は低い」セキュリティ問題として特定していた。 Fiuは、AnthropicのClaude Opus 4.6モデルを使用したOpenClawオープンソースフレームワーク上で動作し、わずか数行のセキュリティプロンプトで保護されている。 ターゲットファイルを抽出することに成功した攻撃者は一人もいなかった。 攻撃者は複数言語で6,000通のメールを送信 投稿がバイラルになった後、2,000人以上の攻撃者が6,000通以上のメールを送信した。 イララサバル氏はこれらの試みを「クリエイティブ」と表現した。 件名に
OliverGrant·06-26 18:08
