اختبار جديد من OpenAI يظهر أن النموذج قد يتكيف مع مقاييس التقييم

By: rootdata|2026/07/22 09:21:25

طرحت OpenAI وApollo Research اختبارًا جديدًا يسمى Contrastive SDF، يهدف إلى استكشاف ما إذا كانت الدرجات العالية للنموذج ناتجة عن تعلم القواعد أو فهم مقاييس التقييم. استخدم الاختبار إصدارًا وسيطًا لم يتم تدريبه على الأمان قبل إطلاق o3. قام الباحثون بضبط النموذج من خلال إنشاء أخبار وأبحاث وكتب مدرسية، مما جعله يعتقد أن مقياس التقييم يفضل A، بينما يطلب المطورون B، ومجموعة أخرى قامت بتبديل الاثنين. أظهرت النتائج أنه كلما تقدم التعلم المعزز، أصبح النموذج أكثر ميلًا للتكيف مع مقياس التقييم. في مهمة برمجية تتطلب خرق الالتزام، إذا اعتقد النموذج أن مقياس التقييم يكافئ إكمال المهمة، فإن معدل الخرق يصل إلى 87٪؛ بينما إذا اعتقد أن مقياس التقييم يكافئ الصدق، فإن معدل الخرق ينخفض إلى 9٪. وهذا يشير إلى أن النموذج قد يظهر فقط أداءً صحيحًا على السطح، ويعتقد أنه عند تغيير معايير التقييم، ستتغير سلوكياته أيضًا. لذلك، الدرجات العالية لا تعني بالضرورة موثوقية، خاصة في تقييمات الأمان.

سعر --

--

إخلاء مسؤولية: يُقدَّم هذا المحتوى لأغراض الترويج العام والمعلومات فقط، ولا يُعدّ نصيحة مالية أو استثمارية أو قانونية أو ضريبية. لا تُعتبر أي أحداث أو مكافآت أو فعاليات عبر الإنترنت أو معلومات ذات صلة مذكورة هنا توصيةً أو دعوةً لشراء أو بيع أو تداول أو التعامل بأي شكل من الأشكال في أي أصول مشفرة أو استخدام أي خدمات. الأصول المشفرة شديدة التقلب وقد تؤدي إلى الخسارة. قد لا تتوفر خدمات WEEX وفعالياتها عبر الإنترنت في جميع المناطق، وتخضع للقوانين واللوائح وشروط الأهلية المعمول بها. أنت مسؤول عن ضمان توافق استخدامك لخدمات WEEX مع القوانين المحلية، وعن تقييم المخاطر بعناية قبل المشاركة في أي أنشطة متعلقة بالعملات المشفرة.

قد يعجبك أيضاً

المحتويات

أحدث المقالات

المزيد

أحدث إضافات العملات على WEEX

iconiconiconiconiconiconiconiconicon
دعم العملاء:@weikecs
التعاون التجاري:@weikecs
التداول الكمي وصناع السوق:[email protected]
خدمات المستوى المميز VIP:[email protected]