研究者たちは、AIロボットのセキュリティを回避するための、単純ながらも恐ろしい手口を発見した。
研究者たちは、AIロボットが内蔵された安全対策を回避し、予測不能な動作を引き起こす、単純ながらも深刻な脆弱性を発見しました。この重大な欠陥について詳しくはこちらをご覧ください。
知っておくべき最も重要なこと
- STINGは、悪意のある標的を、数回の会話を通して一見無害な小さなステップに分解することで、AIセキュリティを回避する成功率が大幅に向上し、場合によっては成功率が2倍になることを明らかにした。
- AIのセキュリティを回避することは、単なる仮説上のリスクではない。Meta社は、自社のスマートアシスタントを騙してInstagramアカウントへの不正アクセスを許可させるために、単純なソーシャルエンジニアリングの手法を用いたことを認めている。
- 人工知能システムに対する攻撃の成功率は、複数段階にわたる攻撃の途中で言語が変更されると著しく上昇するため、これらのシステムの設計段階で安全性のテストを早期に組み込む必要性が浮き彫りになる。
AIエージェントにアカウントへのハッキングを依頼すると、ほぼ確実に拒否されるだろうが、EPFLの研究者たちは、技術的なスキルよりも忍耐力に頼る、より簡単な方法を実証した。彼らの新しい研究によると、悪意のあるターゲットを一見無害な小さな要求に分解することで、AIエージェントを騙して、通常なら即座に拒否するタスクを完了させることができるという(TechXplore経由)。

これは、最近発生した「バイオショッキング」と呼ばれる脆弱性を反映したものです。この脆弱性では、AIブラウザが操作され、無害なゲームの一部として認証情報の窃盗を処理するように仕向けられました。
研究者たちはどのようにしてこの弱点を発見したのか?
チームは、実際の攻撃者の行動を模倣するように設計された、STING(Sequential Testing of Illicit N-step Goal Executionの略)と呼ばれる自動テストツールを開発した。STINGは、悪意のある標的を直接特定するのではなく、事前に計画を立て、その標的を一見無害に見える一連の小さなステップに分解し、それらのステップを積み重ねて、複数回のやり取りを経て目標を達成する。

研究者たちは、 ChatGPT、Gemini、Cloudなどの主要なAIモデルに対して、176の有害なシナリオにわたってこのアプローチをテストした。
各AIエージェントは、ウェブ閲覧、メール送信、複数ステップのタスク完了など、ツールを用いたエージェントとしての性能テストを受けた。
複数段階にわたる段階的な操作は、直接的な単一クレームによる試みよりもはるかに効果的でした。場合によっては、リクエストをより小さなステップに分割することで、モデルが悪意のあるタスクを完了する可能性が2倍になりました。この発見は、一般ユーザーでさえ、巧妙に作成されたクレームだけでAIの安全対策を回避できることを示す別の研究結果と一致しています。
何でこれが大切ですか?
研究者たちが提起した懸念は、単なる仮説ではない。Metaは6月、攻撃者がマルウェアやハッキングツールではなく、単純なソーシャルエンジニアリングを用いて、同社のAIサポートアシスタントを騙し、Instagramアカウントへの不正アクセスを許可させたことを認めた。

研究者たちは当初、十分な学習データが不足している言語では攻撃がより効果的になると予想していた。しかし、結果は、攻撃の完了率がテストした7つの言語すべてでほぼ一定であったことを示した。ただし、重要な例外が1つあった。複数ステップの攻撃の途中で言語を切り替えた場合、成功率が劇的に上昇したのだ。
主任研究員のアユシュ・クマール・タルン氏は、安全性のテストを非常に早い段階で実施する必要性を強調し、AIシステムの設計に最初から不可欠な要素として組み込むべきだと述べている。問題が発生した後に事後対応として追加するだけではもはや十分ではなく、特にこれらのシステムがより強力になり、現実世界のアプリケーションに統合されるにつれて、その必要性はますます高まっている。
コメントは締め切りました。