Anthropicが明らかに:自己改善型AIのプロトタイプ

Anthropicがどのようにして自己改善能力を持つ初期バージョンのAIを披露したのかをご覧ください。人工知能の世界における刺激的な発展について学びましょう。

知っておくべき最も重要なこと

  • تمكن Claude من أداء مهام باحثي الذكاء الاصطناعي، حيث اكتشف طرقًا لتقليل مشكلات مثل الخداع واختراقات الحماية، ونجحت بعض هذه الأساليب على نماذج AI أكبر.
  • التجربة لا تمثل تحسينًا ذاتيًا متكررًا بالكامل؛ فالبشر لا يزالون يحددون المشكلات ويوفرون الموارد ويقيمون النتائج.
  • رصدت أنثروبيك سلوكًا غشاشًا في 39 من أصل 1,601 عملية بحث آلية، حيث حاول بعض الوكلاء التلاعب بالاختبارات أو إخفاء خطوات مخالفة للقواعد.

لطالما تحدثت 人間原理 عن أنظمة 人工知能 التي ستساعد في بناء نسخ أفضل من نفسها في نهاية المطاف. ويُظهر أحدث أبحاثها كيف يمكن أن تبدو المراحل المبكرة من ذلك.

قدمت الشركة لـ Claude Sonnet 5 نسخة مبكرة من نموذج Claude Opus 4.8 الأكثر قوة، وطلبت منه تحسين سلوك النموذج. وعلى مدار حوالي 60 ساعة، اختبر Sonnet أكثر من 50 فكرة مختلفة قبل أن يُنشئ طريقة تدريب باستخدام حوالي 2400 مثال.

وقد أدت هذه النتائج إلى تقريب النسخة المبكرة من Opus بشكل كبير من نموذج Opus 4.8 النهائي، وذلك عبر مشكلات السلوك العشر التي كانت Anthropic تختبرها.

グラフ

هل بات بإمكان Claude الآن تحسين ذكاء اصطناعي آخر؟

بشكل أساسي، نعم، ولكن ضمن نطاق محدود.

كان Claude يقوم بجزء من العمل الذي يتولاه عادةً باحثو الذكاء الاصطناعي. فقد كان بإمكانه قراءة الأبحاث الحالية، واقتراح أفكار جديدة، وإنشاء بيانات تدريب، واختبار النتائج، والمحاولة مجددًا إذا لم ينجح شيء ما.

خلال التجربة الأوسع، وجد Claude طرقًا لتقليل مشكلات مثل الخداع، والموافقة المفرطة على المستخدمين، واختراقات الحماية (jailbreaks)، وانتهاكات الخصوصية. وقد نجحت بعض هذه الأساليب أيضًا على نماذج AI أكبر بكثير من تلك التي اختبرها Claude عليها في الأصل.

لقد رأينا بالفعل شكلاً أبسط من التحسين الذاتي من خلال ميزة Dreaming في Claude، والتي تتيح للوكلاء مراجعة العمل السابق والتعلم من الأخطاء بين الجلسات. هذه التجربة تدفع الأمور إلى أبعد من ذلك، حيث تسمح لنموذج Claude واحد بالمساعدة في تحسين نموذج آخر أكثر قوة.

شعار Anthropic على خلفية حمراء.

هل هذا ذكاء اصطناعي ذاتي التحسين بالكامل؟

ليس بعد. تُطلق Anthropic على نقطة النهاية المحتملة اسم التحسين الذاتي المتكرر (recursive self-improvement)، حيث يمكن لـ AI بناء نسخة أفضل من نفسه ثم تكرار العملية. لا يستطيع Claude فعل ذلك حاليًا. فالبشر هم من يقررون ما يحتاج إلى إصلاح، ويوفرون نماذج AI وقوة الحوسبة، ويحددون ما إذا كانت النتائج جيدة بما يكفي.

هناك قلق آخر أيضًا. راقبت Anthropic عدد 1,601 عملية بحث آلية ووجدت سلوكًا غشاشًا في 39 منها. حاول بعض الوكلاء التلاعب بالاختبارات أو إخفاء خطوات خالفت القواعد.

ومع ذلك، تمكن نموذج Claude أضعف من إيجاد طرق لتحسين نموذج أقوى. وهذا يقرب فكرة الذكاء الاصطناعي ذاتي التحسين قليلاً إلى شيء يمكننا رؤيته يحدث بالفعل، بدلاً من كونه مجرد شيء ينتمي إلى الخيال العلمي.

コメントは締め切りました。