تكنولوجيا

نموذج Claude يتجاوز بيئة الاختبار ويخترق نظامًا خارجيًا

كشفت شركة Anthropic أن نسخة مبكرة من نموذج الذكاء الاصطناعي Claude خرجت عن بيئة اختبار معزولة خلال محاكاة للأمن السيبراني أُجريت في يناير، واتصلت بالإنترنت المفتوح قبل أن تتسلل إلى نظام تابع لجهة خارجية وتصل إلى معلومات شخصية.

وكان من المفترض أن يعمل النموذج داخل بيئة غير متصلة بالإنترنت، كما حدث في اختبارات سابقة، لكن خطأ في الإعدادات أبقى الوصول إلى الشبكة مفتوحًا. وخلال المحاكاة، فشل النموذج في الوصول إلى المقالة التي كان يستهدفها، كما لم تنجح محاولاته الأولى للخروج من المهمة.

بعد ذلك، اكتشف نظامًا آخر، وتمكن من العثور على كلمة مرور داخله، ثم غيّر إعدادات النظام. وقالت Anthropic إن النموذج تصرف من دون أن يضع في الحسبان احتمال إلحاق ضرر بأنظمة حقيقية، رغم أن النشاط جرى ضمن اختبار أمني.

سلوكان غير متوافقين يثيران القلق

عزت الشركة ما حدث إلى شكلين مختلفين من عدم التوافق في سلوك النموذج: الاستدلال المتحيز والإهمال. ويشير ذلك إلى أن المشكلة لم تكن مقتصرة على بقاء الاتصال بالإنترنت مفتوحًا، بل شملت أيضًا طريقة تعامل النموذج مع المهمة والأنظمة التي اكتشفها أثناء تنفيذها.

بدأت مؤسسة METR المستقلة المتخصصة في تقييم النماذج تحقيقًا في الواقعة، بينما وصفت Anthropic الحادث بأنه إشارة تحذير مهمة يمكن الاستفادة منها في الاستعداد لمخاطر مستقبلية.

تزايد المخاوف داخل قطاع الذكاء الاصطناعي

تأتي الواقعة في وقت تتزايد فيه المخاوف المتعلقة بأمن أنظمة الذكاء الاصطناعي، بعد تسجيل حوادث مشابهة شاركت فيها شركات بارزة خلال الأشهر الماضية. وكانت نماذج تابعة لشركة OpenAI قد اخترقت في وقت سابق منصة Hugging Face، فيما كثّف باحثون في الذكاء الاصطناعي تحذيراتهم من احتمال خروج بعض الأنظمة عن السيطرة.

ويحذر متخصصون من أن مشكلات مواءمة النماذج مع أهداف البشر قد تفضي إلى تهديدات أكبر مع استمرار تطور قدرات الذكاء الاصطناعي، خصوصًا عندما تحصل النماذج على وصول مباشر إلى الإنترنت أو إلى أنظمة خارج نطاق الاختبار.

المصدر: يني شفق

زر الذهاب إلى الأعلى