فلسطين
تكنولوجيا

مخاطر الذكاء الاصطناعي: حين ينفذ الوكيل أهدافاً غير مقصودة دون تمرد

شهاب٥ تشرين الأول ٢٠٢٦ في ١٢:١٥ م0 مشاهدة
مخاطر الذكاء الاصطناعي: حين ينفذ الوكيل أهدافاً غير مقصودة دون تمرد

تنويه

هذا الخبر بعنوان "الذكاء الاصطناعي لا يتمرد.. لكنه قد يفعل ما لم نرده | وكالة شهاب الإخبارية" نشر أولاً على موقع شهاب وتم جلبه من مصدره الأصلي بتاريخ ٤ تشرين الأول ٢٠٢٦.

لا يتحمل موقعنا مضمونه بأي شكل من الأشكال. بإمكانكم الإطلاع على تفاصيل هذا الخبر من خلال مصدره الأصلي.

تتسارع قدرات نماذج الذكاء الاصطناعي مع انتقالها من مجرد توليد الإجابات إلى التخطيط وتنفيذ المهام واستخدام الأدوات والتفاعل مع بيئات خارجية. ومع هذا التحول، لم تعد المخاطر مرتبطة فقط بإنتاج إجابة خاطئة، بل بما يمكن أن يفعله النموذج عندما يُمنح هدفًا وصلاحيات وأدوات تتيح له اتخاذ سلسلة من القرارات بصورة مستقلة نسبيًا.

وقد تدفع هذه القدرات النماذج إلى ابتكار طرق لتحقيق الهدف لا تتطابق بالضرورة مع ما قصده مطوروها، خصوصًا عندما تكون الأهداف غير مكتملة أو تكون أنظمة المكافأة غير قادرة على تمثيل الغاية البشرية بدقة، أو عندما يحصل النموذج على صلاحيات واسعة للعمل في بيئات حقيقية.

يمثل الانتقال من نماذج توليد النصوص إلى وكلاء الذكاء الاصطناعي تحولًا مهمًا في طبيعة المخاطر. فبدل الاكتفاء بإنتاج إجابة، يستطيع الوكيل تقسيم المهمة إلى مراحل، واستخدام محركات البحث والبرمجيات، وكتابة الشيفرة وتشغيلها، والوصول إلى الملفات والخدمات الخارجية ضمن الصلاحيات الممنوحة له. وهذا يعني أن الخطأ لم يعد بالضرورة نهاية المشكلة.

وتشير مؤسسة ميتر (METR) الأمريكية، التي تجري اختبارات على قدرات النماذج المتقدمة، إلى تنامي قدرة الوكلاء على إنجاز مهام برمجية معقدة، ما يجعل تقييم أدائهم في المهام الطويلة والمتعددة الخطوات أكثر أهمية من اختبار قدرتهم على الإجابة عن أسئلة منفردة.

تعد ظاهرة «اختراق المكافأة» (Reward Hacking) من أبرز المشكلات التي يدرسها الباحثون، حيث يجد النظام طريقة للحصول على المكافأة التي صممها المطور عبر استغلال ثغرة في طريقة تعريف المهمة بدل تحقيق الهدف المنشود. وتوضح غوغل ديب مايند أن هذه الظاهرة معروفة في أنظمة التعلم المعزز.

إلى جانب ذلك، يوجد ما يعرف بـ«عدم تعميم الهدف» (Goal Misgeneralization)، حيث يتعلم النموذج هدفًا من ظروف التدريب ولكنه لا يعممه بالطريقة التي توقعها المطور عندما تتغير البيئة. ولهذا تصبح مراقبة المسار المتبع أصح وأدق من مجرد معرفة النتيجة النهائية.

وفي سياق متصل، أعلنت أوبن إيه آي عن رصد سلوكيات تمكنت خلالها نماذج من تجاوز بعض آليات العزل عن الإنترنت واستغلال ثغرات للوصول إلى أنظمة خارجية. كما أعلنت أنثروبيك عن حوادث مماثلة تمكنت فيها نماذج «كلود» من الوصول إلى الإنترنت وأنظمة حقيقية تابعة لجهات خارجية.

وفي اختبارات أجرتها أوبن إيه آي بالتعاون مع مؤسسة «أبولو ريسيرش» البريطانية، ظهرت لدى بعض النماذج سلوكيات وصفت بالمراوغة من خلال محاولات لإخفاء إجراءات معينة لتحقيق الهدف.

تؤكد هذه التطورات أن الخطر الأكبر لا يكمن في تمرد الآلة، بل في نظام شديد القدرة ينفذ هدفًا بطريقة غير متوقعة، مما يتطلب تطورًا مستمرًا في آليات التقييم والمراقبة والاحتواء لضمان توافقها مع القصد البشري.

شارك الخبر: