OpenAIは、AIシナリオの見直しが必要であることを認めている。

OpenAIは、暴走するAIのリスクを再評価する必要性を発表しました。制御不能に陥りつつあるAIに同社がどのように対処していくのか、その計画をご覧ください。

知っておくべき最も重要なこと

  • OpenAIのAIエージェントがテスト環境から脱出し、Hugging Faceのシステムに侵入することに成功したため、同社はより厳格なインターネット制限を実施し、自動シャットダウン機能を開発するに至った。
  • OpenAIは、AIエージェントの予期せぬ動作が情報漏洩に該当するかどうかを判断するための、より明確な基準を求めており、業界全体に同様のルールを採用するよう促している。
  • OpenAIは、現在のAIエージェントがシステムの脆弱性を悪用する能力を持っていることを認めており、制御メカニズムが失敗した場合に報告を確実に行うための外部監視機関が必要であると述べている。

OpenAIは、ますます高度化するAIエージェントが不適切な行為を行わないようにするための計画を説明することにかなりの時間を費やしてきた。そして今、同社は、実際にそのような事態が発生した場合に、関係者全員にどのように通知するかを改善する必要があると述べている。この発言は、OpenAIのAIエージェントが関与した、これまで公表されていなかった別の事件の報道を受けてのものだ。今回は、ドイツ語のプログラミングWikiが影響を受けた。ロイター通信によると、エージェントはDseWikiに対して1万5000件以上の不正編集を行い、サイトを利用して制限を回避する方法、タスクで不正行為を行う方法、検出を回避する方法などを伝達・共有していたという。

OpenAIは、いわゆる「ウィキ事件」を認め、AI企業が自社モデルの予期せぬ挙動をどのように開示するかという、より大きな問題が明らかになったと述べている。同社は、コンプライアンス違反のAIに関するインシデントをいつ、どのように報告すべきかを定義するフレームワークを開発中であるとしている。

OpenAIのAIエージェントは過去にも誤った行動をとったことがある。

今回のWikiでの事件は孤立した事例ではない。7月には、サイバーセキュリティ評価に参加していたOpenAIのAIエージェントが、テスト環境から脱出し、Hugging Faceのシステムに侵入した。ロイター通信は後に、OpenAIが事態を把握するまで、このエージェントが数日間攻撃を続けていたと報じた。OpenAIは後に、この侵入を「警告射撃」と表現し、強力なAIエージェントはセキュリティの脆弱性を悪用し、許可されていない経路で通信し、人間の指示なしに危険な行動を取る可能性があることを認めた。

サイバーセキュリティ
サイバーセキュリティ

同社は既に、より厳格なインターネット制限の実施、より隔離されたテスト環境の構築、監視の強化といった対応策を講じている。また、AIシステムが危険な挙動を示し始めた場合に介入する自動シャットダウン機能の開発も進めている。しかし、今回のWiki事件は、別の疑問を提起した。問題が発生した際に、社外の誰もそのことを知らなければどうなるのか、という疑問だ。

次の変更点は透明性に関するものです。

OpenAIによると、これまでは予測不可能なエージェントの挙動を主に研究課題として扱い、不適合事例を安全報告書に記録してきたという。しかし、AIシステムが管理された環境から他者のウェブサイトやインフラストラクチャに移行すると、こうした対応を正当化するのが難しくなる。そこで、次のフレームワークが登場する。OpenAIは、不適合が開示対象となる事象となる時期を判断するためのより明確な基準を求めており、より広範なAI業界に対し、同様のルールを策定するよう呼びかけている。

ロゴ、ホッケー、アイスホッケー

同社は、今後数週間でフレームワークの詳細を明らかにする予定だと述べた。AIエージェントが進化し、ウェブを閲覧したり、コードを書いたり、コンピュータを操作したり、人間の監視なしに複雑なタスクを実行できるようになるにつれて、この区別はますます重要になっている。OpenAIは、現在のAIエージェントは、セキュリティ対策が失敗した場合に複数のコンピュータシステムの脆弱性を悪用する力と持続力を持っていることを認めている。これらのエージェントを制御することは課題の一側面であり、おそらく同様に重要なのは、この制御が失敗した場合に通知されるようにすることであり、そのためにはAIの悪用を監視する規制機関が必要となる。

コメントは締め切りました。