クロードAIは会話を終了する能力を持つようになりました。これは、極端な状況に対処するための新しいメカニズムです。

ここ数ヶ月、Anthropicは安全性の分野における取り組みを強化し、AIの安全性を高めるための機能の実装や研究を進めてきた。最新の機能であるCloudは、これまでで最も重要な機能の一つとなるだろう。

クロードAIが会話を終了させる能力を獲得:極限状況に対処するための新たなメカニズム | Tom's Guide

Claude Opus 4と4.1(Anthropicの最新バージョン)の両方に、ユーザーのチャットインターフェースで会話を終了できる機能が追加されました。この機能は広く利用されることはないものの、「継続的に有害または虐待的なユーザーインタラクション」という稀で極端なケースのために実装されています。

新機能について解説したブログ記事の中で、Anthropicチームは次のように述べています。「クラウドやその他の大規模言語モデルが、現在および将来において倫理的にどのような位置づけになるのか、私たちはまだほとんど確信が持てません。しかし、私たちはこの問題を非常に真剣に受け止めています。」

アントロピック社の最新モデルの発売に先立つテストでは、モデルの福祉に関する評価が行われました。これにはクロードの自己申告と行動の好みの調査も含まれており、クロードは一貫して強い危害嫌悪を示していることが分かりました。

Claudeやその他の大規模言語モデルの倫理的地位については、現在そして将来においても依然として不確かな点が多くありますが、私たちはこの問題を真剣に受け止めています。

人間原理

言い換えれば、クロードはこれらの会話を事実上遮断するか、参加を拒否することになります。これには、未成年者を巻き込んだ性的コンテンツのユーザーリクエストや、広範囲にわたる暴力やテロ行為を可能にする可能性のある情報の要求などが含まれます。

こうしたケースの多くでは、クロード氏が積極的に拒否したにもかかわらず、ユーザーは有害または虐待的な要求を執拗に続けました。クロード氏が効果的に会話を終了できるようにするこの新機能は、こうした状況において一定の保護を提供することを目指しています。

Anthropic は、この機能はユーザーが自分自身または他人に危害を加える差し迫った危険がある状況では適用されないと説明しています。

「いずれの場合も、Claude は、リダイレクトの試みが複数回失敗し、生産的なやり取りの望みが完全に失われた場合、またはユーザーが Claude にチャットの終了を明示的に要求した場合にのみ、最後の手段として会話を終了する機能を使用する必要があります」と、Anthropic チームはブログ投稿で続けています。

ノートパソコン上のクラウド

「このような事態が発生するシナリオは極端かつ稀です。大多数のユーザーは、クロード氏と非常に議論の多い問題について議論しているときであっても、通常の製品使用ではこの機能に気付いたり、影響を受けたりすることはありません。」

ユーザーはその会話に新しいメッセージを送信できなくなりますが、アカウントで別の会話を開始することは可能です。長い会話スレッドが失われる可能性に対処するため、以前のメッセージを編集し、会話の新しいブランチを再度作成することは可能です。

これはAnthropic社による非常にユニークなアプリケーションです。Claudeの最も近い競合であるChatGPTGeminiGrokの3社は、同様の機能を提供しておらず、他のセキュリティ対策は提供しているものの、ここまで徹底した対策は講じていません。

コメントは締め切りました。