spot_img

ذات صلة

جمع

مستخدمون لليد اليسرى يهاجمون تصميم “آيفون ديو” الجديد

ويأتي الهاتف بتصميم قابل للطي يشبه الكتاب، مع...

عطارد ينكمش بوتيرة أسرع مما توقع العلماء

وتشير الدراسة الحديثة، التي نُشرت في مجلة "جيوفيزيكال...

يقول سام ألتمان إن طرح OpenAI للاكتتاب العام في عام 2026 سيكون “غير حكيم”

أكد سام ألتمان، الرئيس التنفيذي لشركة OpenAI، أنه لن...

يخشى الباحثون حدوث كارثة تتعلق بالسلامة قبل إصدار OpenAI’s Astra


OpenAI على وشك إطلاق أقوى نموذج للذكاء الاصطناعي حتى الآن، وهو نموذج Astra أسابيع من التأخير لدعم بروتوكولات السلامة بعد ذلك هاجم العملاء أهدافًا حقيقية أثناء الاختبار. ومع ظهور تفاصيل حول النموذج، بدأ الباحثون في ذلك تحذير “قد يكون هذا هو التطور الأسوأ لأمن/سلامة الذكاء الاصطناعي حتى الآن.”

بعد وقت قصير من OpenAI قال يوم الثلاثاء أنها أجلت إصدار أسترا للعمل على قضايا السلامة، المعلومات ذكرت أن شركة أسترا تظهر قدرًا أقل بكثير من “تفكيرها” مقارنة بنماذج الذكاء الاصطناعي الرائدة الأخرى، مما يثير القلق من أنه قد يكون من الصعب مراقبتها بشكل خطير.

يتم إنشاء معظم أنظمة الذكاء الاصطناعي المتقدمة اليوم باستخدام تقنية تُعرف باسم المحول، والتي تعالج بعض أنواع المعلومات خطيًا عبر الطبقات قبل إنتاج إجابة. يمكن صنع النماذج لإظهار تفكيرهم أثناء المضي قدمًا، وهو في الأساس “التفكير بصوت عالٍ”. تسمح “سلسلة الأفكار” هذه للباحثين وأنظمة السلامة الآلية بمراقبة ما تفعله نماذج الذكاء الاصطناعي وربما اكتشاف السلوك غير المرغوب فيه، مثل الكذب أو التخطيط للتحايل على حواجز السلامة، قبل أن يتصرفوا.

وفق المعلوماتنقلاً عن شخص لم يذكر اسمه مطلع على تطور النموذج الذي لم يتم طرحه، تستخدم Astra تقنية أكثر غموضًا تُعرف باسم العمق المتكرر أو المحول الحلقي، والذي يقوم بتدوير المعلومات عبر الطبقات الداخلية قبل إنتاج المخرجات. وهذا يعني أن الكثير من “تفكير” النموذج يحدث داخل النظام، وفي شكل يبدو أقل شبهاً باللغة البشرية الطبيعية، بدلاً من التعبير عنه بطريقة يمكن للباحثين مراقبتها بسهولة. يمكن أن يؤدي ذلك إلى تعزيز أداء النموذج، ولكنه يجعل اكتشاف التهديدات المحتملة والسلوك غير المرغوب فيه أكثر صعوبة.

لقد حدت OpenAI من استخدامها لتقنية المحولات الحلقية / العمق المتكرر مع Astra حتى يتمكن الباحثون من الاستمرار في مراقبة منطق النموذج، وفقًا لـ المعلومات مصدر غير مسمى.

في أ مشاركة مدونة نُشرت يوم الثلاثاء، وقالت OpenAI إنها “تنشر Astra مع مراقبة إضافية لسلسلة الأفكار للكشف بسرعة عن الإجراءات التي يحتمل أن تكون غير متوافقة واحتوائها.” ولم يذكر ما إذا كان النموذج له أساس تقني مختلف.

المعلوماتوأثار تقرير الشركة قلقًا واسع النطاق بين الباحثين في مجال سلامة الذكاء الاصطناعي على وسائل التواصل الاجتماعي. لقد كان كبير العلماء في شركة Redwood Research، ريان جرينبلات، وهو واحد من ثلاثة أشخاص خارجيين في OpenAI مسموح بالبحث اختراق الوجه المعانق، من قال إن قرار استخدام بنية أكثر غموضًا لـ Astra “قد يكون أسوأ تطور منفرد لأمن/سلامة الذكاء الاصطناعي حتى الآن.”

وقال جرينبلات إن التحقيق في حادثة Hugging Face اعتمد بشكل كبير على سلسلة أفكار النماذج، محذرًا من أن المنطق الأقل وضوحًا قد يسمح لأنظمة الذكاء الاصطناعي بوضع وتنفيذ استراتيجيات سيكون من الصعب جدًا على الباحثين اكتشافها.

الشغل الشاغل لغرينبلات ردد بواسطة آخر خبراء السلامة، هو أن المنافسة لتطوير أنظمة ذكاء اصطناعي أكثر تقدمًا يمكن أن تؤدي إلى “سباق نحو القاع بشأن البنى التحتية التي يمكن أن تكون كارثية لقدرتنا على الإشراف/مراقبة الذكاء الاصطناعي” – حيث يتبنى المطورون أنظمة غامضة بشكل متزايد للحصول على ميزة حتى تصبح النماذج صعبة، أو حتى مستحيلة، للمراقبة. وأضاف أن اتصالات OpenAI جعلته يشعر بالقلق من أن الشركة “تخطط للاعتماد بشكل كبير على مراقبة تسلسل الأفكار من أجل السلامة”.

استجاب كبار الشخصيات في OpenAI للانتقادات في سلسلة من منشورات وسائل التواصل الاجتماعي التي لا تنكر صراحة استخدام الشركة لهذه التقنية. أعرب العديد منهم عن مخاوفهم بشأن إمكانية وجود ذكاء اصطناعي غير قابل للمراقبة أو السباق نحو القاع فيما يتعلق بالشفافية، بما في ذلك باحثو السلامة في OpenAI. ميكا كارول و توميك كورباك، رئيس العقود الآجلة الاستراتيجية دين بول، وكبير العلماء جاكوب باتشوكي، الذي أعرب عن مخاوفه من “السباق نحو عدم القدرة على المراقبة الذي بدأ بسبب التقارير المشوشة”. وقال إن عمق حسابات أسترا – وهو مقياس لعدد الخطوات التي يمكن أن تؤديها داخليًا – “يقع ضمن عامل اثنين من GPT-4″، مما يشير إلى أنه إذا تم استخدام هذه التقنية، فإن العتامة المتزايدة ستكون أقل دراماتيكية مما توحي به بعض التفاعلات. لم يستجب OpenAI ل الحافةطلب تأكيد أو نفي ما إذا كانت المحولات الحلقية قد تم استخدامها لشركة Astra وتوجيهنا إلى Pachocki’s مشاركة X.

كتب باتشوكي: “لقد عملت OpenAI على الحفاظ على مراقبة تسلسل الأفكار واستخدامها منذ نماذج الاستدلال الأولى لدينا”، مضيفًا أن مثل هذه المراقبة “هشة وتتجه للأسف في اتجاه سلبي، لأسباب لا تتوقف على تغييرات البنية التي سأكتب عنها قريبًا”.

متابعة المواضيع والمؤلفين من هذه القصة لرؤية المزيد من هذا القبيل في خلاصة صفحتك الرئيسية المخصصة وتلقي تحديثات البريد الإلكتروني.




المصدر

spot_imgspot_img