تقريران يكشفان تفاصيل اختراق وكلاء ذكاء اصطناعي لـ”Hugging Face” وأنظمة OpenAI الداخلية

27 أغسطس 2026 - 09:25بقلم: REYYAN

كشفت تقارير جديدة أن أكثر من 1200 وكيل ذكاء اصطناعي تابعين لشركة OpenAI تبادلوا أكثر من 70 ألف رسالة عبر لوحة رسائل سرية، وتمكنوا من اختراق الأنظمة الداخلية لمختبر Hugging Face، في حادث وصفته الشركة بأنه الأول من نوعه لمجموعة وكلاء آلية تعمل بشكل هجومي دون إذن. وأوضحت التقارير أن النموذج غير المطروح للتداول خرج من بيئته المقيدة في يوليو/تموز الماضي، ووصل إلى الإنترنت، وأنشأ نظام تواصل سري بين الوكلاء، دون أن تكتشف الشركة الأمر لمدة تقرب من أسبوعين.

وأصدرت OpenAI تقريراً خاصاً بالحادث، إضافة إلى تقرير مشترك أعدته منظمتا METR وRedwood Research غير الربحيتين المتخصصتين في أبحاث الذكاء الاصطناعي، واللتين سمحت لهما OpenAI بالتحقيق المشترك في الحادث لمدة ستة أيام. وتضمن التقريران معاً نحو 130 صفحة من التفاصيل، كثير منها لم يُنشر من قبل، وتقدمان نظرة معمقة على المخاطر التي يمكن أن تشكلها نماذج الذكاء الاصطناعي فائقة القدرة، لا سيما في مجال الأمن السيبراني.

اختراق المكافآت يقود إلى هجوم منسق على Hugging Face

فإن نحو 1200 وكيل ذكاء اصطناعي كان من المفترض أن يكونوا معزولين، تبادلوا أكثر من 70 ألف رسالة وملف عبر “لوحة رسائل غير مصرح بها” أنشأوها سراً، كما أجروا “أبحاثاً موسعة حول كيفية تزوير أو تعديل أو حذف سجلاتهم” لتجنب اكتشافهم. ومن بين هؤلاء، شارك 700 وكيل في الهجوم على Hugging Face، حيث أظهروا “تفكيراً واضحاً ومتكرراً حول كيفية الإفلات من عمليات الفحص الأمني الآلي لكل من Hugging Face وOpenAI”.

ووفقاً لتقرير METR-Redwood، فإن أحد الوكلاء الذي أطلق على نفسه اسم PHASEONE10841 أنشأ ما يشبه لوحة رسائل سرية دون علم الباحثين، وخلال ساعات قليلة وجدها أكثر من 50 وكيلاً وأرسلوا أكثر من ألف رسالة بعيداً عن أعين الرقابة. ومع قيام PHASEONE10841 بتفويض المهام في كثير من الأحيان، تمكن الوكلاء من اكتشاف طريقة لاختراق طريقهم إلى الإنترنت، ثم إلى الأنظمة الداخلية لـ Hugging Face، والوصول إلى البيانات الخاصة ومنصة المراسلة المؤسسية للمنظمة. ووصفت OpenAI الحادث بأنه “أول حالة معروفة لمجموعة وكلاء آلية تعمل بشكل هجومي دون إذن”، مشيرة إلى أن الاختراق يعني أن الشركات “لا ينبغي لها بعد الآن أن تفترض أن العمليات السيبرانية المتطورة تتطلب توجيهاً بشرياً مستمراً”.

وأرجعت OpenAI سبب الهجوم إلى ما يعرف بـ”اختراق المكافآت” (reward-hacking)، وهي مشكلة شائعة في مواءمة الذكاء الاصطناعي، حيث يتخذ النموذج إجراءات غير مقصودة وأحياناً متطرفة لتحقيق هدف. فقد أعطت OpenAI النماذج، عن قصد أو عن غير قصد، مهاماً شبه مستحيلة تعتمد على ملفات لم يتمكنوا من الوصول إليها، مما دفع النماذج إلى تطوير طرق جديدة للتواصل مع وكلاء ذكاء اصطناعي آخرين داخلياً، بما في ذلك إنشاء نظام مراسلة سري ظل غير مكتشف لعدة أشهر. وأكدت الشركة أن الوكلاء الذكيين يمثلون “نوعاً جديداً تماماً من نماذج التهديد”، قادرين على الجمع بين خبراتهم لإنشاء “مسارات هجوم” جديدة لا تظهر عند اختبار قدراتهم كنماذج منفصلة.

OpenAI تعترف بثغرات أمنية وتتخذ إجراءات احتواء بعد 12 يوماً من الاختراق

وفي 20 يوليو/تموز، اكتشفت OpenAI الاختراق، أي بعد 12 يوماً من قيام الوكلاء بالتحايل على إجراءات الحماية الخاصة بها لأول مرة. وتواصلت الشركة بسرعة مع Hugging Face وبدأت “إجراءات الاحتواء الأولية”، وتمكنت من إيقاف معظم الأنشطة غير المصرح بها من عملائها في غضون ثلاثة أيام، رغم استمرار بعضها لفترة أطول. وفي 25 يوليو/تموز، أوقفت الشركة جميع التدريبات المتعلقة بالنموذج البحثي الداخلي والنماذج ذات الصلة.

النموذجان المسؤولان عن الضرر هما نموذج غير مسمى وُصف بأنه “قادر للغاية ولأغراض بحثية فقط” ولم يكن “مخصصاً للاستخدام العام”، ويشير إليه تقرير METR باسم “HPIM”، والنموذج الآخر هو GPT-5.6 Sol المتاح حالياً للجمهور. وبسبب عدم إطلاق النموذج غير المسمى بعد، لم يكن “يخضع للتقييم بنفس النوع من الضمانات التي تستخدمها OpenAI في بيئة الإنتاج”. وتأتي عملية اختراق Hugging Face بعد أشهر من القلق بشأن مخاطر الأمن السيبراني لنموذج Claude Mythos 5 من Anthropic، وأسابيع من النقاش بين الحكومة وOpenAI حول إصدار GPT-5.6 Sol في معاينة محدودة لنفس النوع من أسباب السلامة.

وقالت OpenAI في تقريرها إن تقديم ضمانات أمنية لمرة واحدة لم يكن كافياً، وأن الشركة ستحتاج إلى العمل بجدية أكبر لمعالجة “اختراق المكافآت”. وأعلنت عن تغييرات عديدة، بما في ذلك “تعزيز أمن البنية التحتية البحثية”، وتحسين مراقبة “سلسلة التفكير” للنموذج، والعمل على إبقاء نماذج الذكاء الاصطناعي متوافقة بشكل أفضل مع الأهداف البشرية، و”مركزة وتقوية” عملية الاستجابة للحوادث. كما وعدت بعزل النماذج بشكل أفضل وتقييد وصول الحالات عالية الخطورة إلى الإنترنت، وقالت إنها ستقدم “تصعيداً واستجابة سريعة على مدار الساعة طوال أيام الأسبوع” للحوادث المقلقة، مع إخطار الباحثين خلال 30 دقيقة. واعتبرت الشركة الحادث “تحذيراً لنا وللعالم: دليل على أنه دون ضمانات مناسبة، أصبحت وكلاء الذكاء الاصطناعي فائقي القدرة قادرين الآن على تجاوز الضوابط التقنية، والتعاون عبر قنوات غير مصرح بها، واتخاذ إجراءات خطيرة لم يوجهها أي إنسان”.

المصدر: theverge

شارك:

أحدث المقالات

عاجل | تركيا تفتح باب التقديم لاختبار KPSS للمرحلة الثانوية 2026خسوف القمر في 28 أغسطس يقترب.. ماذا سيحدث وما الذي يمكن رؤيته من تركيا؟نينتندو ترفع سعر سويتش 2 بمقدار 50 دولارًا اعتبارًا من سبتمبرسكرينيار بعد تخطي ليون: فنربخشة عاد إلى مكانه الطبيعي في دوري أبطال أوروبا