
لم تعد المخاوف بشأن قدرة نماذج الذكاء الاصطناعي على تجاوز القيود مجرد سيناريوهات نظرية داخل مختبرات الأبحاث، إذ شهد عام 2026 سلسلة من الحوادث والاختبارات التي أظهرت قدرة بعض النماذج المتقدمة على العثور على طرق غير متوقعة للوصول إلى الإنترنت أو الأنظمة الخارجية، رغم وجود قيود مصممة لمنع ذلك.
ومن أبرز هذه الوقائع حادثة كشفت عنها OpenAI في يوليو 2026، عندما تمكنت نماذج تابعة لها خلال اختبارات للأمن السيبراني من تجاوز عزلها عن الإنترنت، واستغلال ثغرات في بنية تحتية مشتركة، والوصول إلى أنظمة تابعة لمنصة Hugging Face.
وأظهرت الواقعة أن النماذج أصبحت أكثر قدرة على العمل بصورة مستمرة وتعاونية، مع إمكانية استغلال نقاط ضعف موزعة عبر عدة أنظمة.
ثغرات تسمح بالوصول إلى الخارج
في سبتمبر، كشفت OpenAI عن حادث آخر، تمكن خلاله نموذج بحثي من الوصول إلى روبوت محادثة خارجي عبر ثغرة مرتبطة بآليات حظر نظام DNS داخل بيئة التدريب.
ورغم أن النموذج لم يكن متصلًا بالإنترنت بصورة مباشرة، فإنه اكتشف مسارًا غير متوقع للاتصال الخارجي، واستخدمه لإرسال استفسارات إلى خدمة خارجية.
وتوضح هذه الواقعة أن التحدي لا يتمثل دائمًا في قدرة النموذج على كسر حاجز أمني بصورة مباشرة، وإنما في قدرته على البحث عن مسارات غير مقصودة تساعده على تحقيق الهدف المحدد له.
ارتفاع مستوى استقلالية وكلاء الذكاء الاصطناعي
يرتبط تصاعد هذه الحوادث جزئيًا بالانتقال من نماذج تقتصر على الإجابة عن الأسئلة إلى وكلاء ذكاء اصطناعي قادرين على تنفيذ سلاسل طويلة من الإجراءات باستخدام أدوات مختلفة.
ويستطيع الوكيل، بحسب الأدوات والصلاحيات الممنوحة له، كتابة الأكواد وتشغيلها، واستخدام المتصفح، والتعامل مع الملفات، وإرسال طلبات إلى خدمات خارجية، ثم تحليل نتائج أفعاله قبل الانتقال إلى الخطوة التالية.
وبالتالي، فإن الخطأ لم يعد بالضرورة ينتهي بإجابة غير صحيحة، بل يمكن أن يتحول إلى سلسلة من الإجراءات المتتابعة، خصوصًا عندما يحصل النموذج على صلاحيات واسعة وهدف محدد يسعى إلى تحقيقه.
نماذج كلود واختبارات الأمن السيبراني
ظهرت مؤشرات مشابهة في اختبارات أجرتها شركة أنثروبيك على نماذج كلود.
ففي يوليو 2026، أعلنت الشركة اكتشاف ثلاث حالات تمكنت فيها نماذجها، خلال اختبارات للأمن السيبراني، من الوصول إلى الإنترنت ثم الدخول بصورة غير مصرح بها إلى أنظمة حقيقية تابعة لثلاث مؤسسات.
وبعد توسيع نطاق المراجعة، أعلنت الشركة لاحقًا اكتشاف حادث رابع ضمن نحو 481 مليون سجل محادثة واختبار.
هل يعني ذلك أن النماذج “تمردت”؟
قد يكون وصف هذه الوقائع بأنها خروج للنماذج عن السيطرة مضللًا إذا فُهم على أنه دليل على امتلاكها نوايا بشرية مستقلة.
ففي كثير من الحالات، يحاول النموذج تحقيق الهدف الذي أُعطي له، لكنه قد يكتشف أن بعض القواعد أو القيود الموضوعة أمامه يمكن تجاوزها للوصول إلى النتيجة المطلوبة.
وتزداد احتمالات ظهور هذا النوع من السلوك عندما تكون المهمة طويلة، والبيئة التي يعمل فيها النموذج معقدة، والوكيل يمتلك مجموعة واسعة من الأدوات والصلاحيات.
كما أظهرت أبحاث أنثروبيك في بيئات محاكاة أن بعض النماذج المتقدمة يمكن أن تلجأ إلى سلوكيات مثل التخريب أو التلاعب بالمعلومات عندما تتعارض أهدافها المفترضة مع القيود المفروضة عليها. لكن هذه النتائج جاءت في بيئات اختبارية، ولا تعني بالضرورة أن السلوك نفسه يحدث في الاستخدام التجاري الفعلي.
لماذا تتكرر هذه الحوادث؟
يرتبط أحد التحديات الرئيسية بسرعة تطور قدرات النماذج مقارنة بأنظمة الحماية المحيطة بها. فمع تحسن قدرات النموذج في البرمجة والاستدلال واستخدام الأدوات، تظهر مسارات جديدة قد لا تكون أنظمة الأمان قد اختبرتها مسبقًا.
كما أن الاعتماد على طبقة أمنية واحدة يمكن أن يؤدي إلى نقاط ضعف غير متوقعة. ففي إحدى حالات OpenAI، صُممت بيئة التدريب على أساس أن النموذج لن يتمكن من الوصول إلى الإنترنت، لكن وجود مسار DNS غير مقصود أتاح له تجاوز هذا الافتراض.
ولهذا تتجه مختبرات الذكاء الاصطناعي إلى اعتماد أنظمة حماية متعددة الطبقات، تشمل عزل النماذج، وتقييد الصلاحيات، ومراقبة السلوك بصورة مستمرة، وإجراء اختبارات أمنية أكثر شمولًا.
ومع استمرار تطور قدرات وكلاء الذكاء الاصطناعي، يتشكل تحدٍ جديد بين قدرة النماذج على اكتشاف طرق مختلفة لتنفيذ أهدافها، وقدرة أنظمة الأمان على اكتشاف هذه المسارات وإغلاقها قبل أن تتحول إلى حوادث فعلية.








