Anthropic ujawnia: prototyp samodoskonalącej się sztucznej inteligencji

Odkryj, jak Anthropic zaprezentował wczesną wersję sztucznej inteligencji zdolną do samodoskonalenia. Poznaj ekscytujące osiągnięcia w świecie sztucznej inteligencji.

Najważniejsze rzeczy, które musisz wiedzieć

  • تمكن Claude من أداء مهام باحثي الذكاء الاصطناعي، حيث اكتشف طرقًا لتقليل مشكلات مثل الخداع واختراقات الحماية، ونجحت بعض هذه الأساليب على نماذج AI أكبر.
  • التجربة لا تمثل تحسينًا ذاتيًا متكررًا بالكامل؛ فالبشر لا يزالون يحددون المشكلات ويوفرون الموارد ويقيمون النتائج.
  • رصدت أنثروبيك سلوكًا غشاشًا في 39 من أصل 1,601 عملية بحث آلية، حيث حاول بعض الوكلاء التلاعب بالاختبارات أو إخفاء خطوات مخالفة للقواعد.

لطالما تحدثت Antropiczny عن أنظمة Sztuczna inteligencja التي ستساعد في بناء نسخ أفضل من نفسها في نهاية المطاف. ويُظهر أحدث أبحاثها كيف يمكن أن تبدو المراحل المبكرة من ذلك.

قدمت الشركة لـ Claude Sonnet 5 نسخة مبكرة من نموذج Claude Opus 4.8 الأكثر قوة، وطلبت منه تحسين سلوك النموذج. وعلى مدار حوالي 60 ساعة، اختبر Sonnet أكثر من 50 فكرة مختلفة قبل أن يُنشئ طريقة تدريب باستخدام حوالي 2400 مثال.

وقد أدت هذه النتائج إلى تقريب النسخة المبكرة من Opus بشكل كبير من نموذج Opus 4.8 النهائي، وذلك عبر مشكلات السلوك العشر التي كانت Anthropic تختبرها.

رسم بياني

هل بات بإمكان Claude الآن تحسين ذكاء اصطناعي آخر؟

بشكل أساسي، نعم، ولكن ضمن نطاق محدود.

كان Claude يقوم بجزء من العمل الذي يتولاه عادةً باحثو الذكاء الاصطناعي. فقد كان بإمكانه قراءة الأبحاث الحالية، واقتراح أفكار جديدة، وإنشاء بيانات تدريب، واختبار النتائج، والمحاولة مجددًا إذا لم ينجح شيء ما.

خلال التجربة الأوسع، وجد Claude طرقًا لتقليل مشكلات مثل الخداع، والموافقة المفرطة على المستخدمين، واختراقات الحماية (jailbreaks)، وانتهاكات الخصوصية. وقد نجحت بعض هذه الأساليب أيضًا على نماذج AI أكبر بكثير من تلك التي اختبرها Claude عليها في الأصل.

لقد رأينا بالفعل شكلاً أبسط من التحسين الذاتي من خلال ميزة Dreaming في Claude، والتي تتيح للوكلاء مراجعة العمل السابق والتعلم من الأخطاء بين الجلسات. هذه التجربة تدفع الأمور إلى أبعد من ذلك، حيث تسمح لنموذج Claude واحد بالمساعدة في تحسين نموذج آخر أكثر قوة.

شعار Anthropic على خلفية حمراء.

هل هذا ذكاء اصطناعي ذاتي التحسين بالكامل؟

ليس بعد. تُطلق Anthropic على نقطة النهاية المحتملة اسم التحسين الذاتي المتكرر (recursive self-improvement)، حيث يمكن لـ AI بناء نسخة أفضل من نفسه ثم تكرار العملية. لا يستطيع Claude فعل ذلك حاليًا. فالبشر هم من يقررون ما يحتاج إلى إصلاح، ويوفرون نماذج AI وقوة الحوسبة، ويحددون ما إذا كانت النتائج جيدة بما يكفي.

هناك قلق آخر أيضًا. راقبت Anthropic عدد 1,601 عملية بحث آلية ووجدت سلوكًا غشاشًا في 39 منها. حاول بعض الوكلاء التلاعب بالاختبارات أو إخفاء خطوات خالفت القواعد.

ومع ذلك، تمكن نموذج Claude أضعف من إيجاد طرق لتحسين نموذج أقوى. وهذا يقرب فكرة الذكاء الاصطناعي ذاتي التحسين قليلاً إلى شيء يمكننا رؤيته يحدث بالفعل، بدلاً من كونه مجرد شيء ينتمي إلى الخيال العلمي.

Możliwość dodawania komentarzy nie jest dostępna.