تکامل هوش مصنوعی: مرزها و حقیقت خودبهبودی بازگشتی (RSI)
نویسنده: ژائو ژیمین، دکتری از دانشگاه کویینز کانادا (حوزه پژوهش: هوش کد و مدلهای جهان)
اگر اولین بار است که درباره RSI میشنوید، این مقاله میتواند راهنمایی مقدماتی برایتان باشد. از پایه با RSI آشنا میشویم؛ از نخستین تلاشها برای خودبهبودی در هوش مصنوعی آغاز میکنیم، به عاملهای امروزی میپردازیم که میتوانند کد را تغییر دهند، داده آموزشی تولید کنند و در توسعه مدل مشارکت داشته باشند، و میبینیم هوش مصنوعی چگونه بهتدریج یاد میگیرد خودش را بهبود دهد.
در 07/2026، OpenAI مدل GPT-5.6 را منتشر کرد. برای نخستین بار، موضوعی تازه و تا حدی غیرمعمول در کارنامه آن ظاهر شد: آیا هوش مصنوعی میتواند در بهبود خودِ هوش مصنوعی مشارکت کند؟
OpenAI این توانایی را «خودبهبودی» نامید. امتیاز GPT-5.6 Sol برابر %57.9 بود، درحالیکه GPT-5.5 امتیاز %41.7 را کسب کرد؛ یعنی بین دو نسل از مدلها 16.2 واحد درصد اختلاف وجود داشت. موضوع این نیست که مدل چند مسئله متداول را حل میکند، بلکه این است که آیا میتواند وارد فرایند توسعه هوش مصنوعی شود یا نه: عیبیابی سامانههای پژوهشی، بهینهسازی برنامههای کرنل GPU و دستورالعملهای آموزش، اجرای آزمایشهای یادگیری ماشین و حتی کمک به بهبود مدلی دیگر.
این خبر اتفاقی مجزا نیست. در همان تابستان، OpenAI از عاملها با عنوان «کارآموزان پژوهشی خودکار» یاد کرد. AgentX شرکت Kuaishou هماکنون عاملها را در پیشنهاد راهحل، نوشتن کد و انجام آزمونهای آنلاین A/B برای مقایسه نسخههای جدید و قدیمی به کار گرفته است. Google اعلام کرد که چرخههای طولانیمدت عاملها در اصلاح نسخه بعدی مدل مشارکت داشتهاند. Motus2 نیز پیشبینی، ارزیابی و بهروزرسانی راهبردها را به رباتهای واقعی آورده است.
این نمونهها اجرای پژوهش، آزمایشهای صنعتی، آموزش مدل و اقدامات فیزیکی را دربرمیگیرند، اما هیچکدام به مهمترین پرسش پاسخ نمیدهند: آیا سامانه بهبودیافته در انجام دور بعدی بهبود نیز بهتر عمل خواهد کرد؟
دقیقاً همین پرسش را خودبهبودی بازگشتی (RSI) مطرح میکند. OpenAI این ارزیابی را RSI Index مینامد که «توانایی دستیابی به RSI» را میسنجد. ازآنجاکه پرسشهای کامل، وزندهی وظایف و فرمولهای تجمیع منتشر نشدهاند، %57.9 را فقط میتوان یک معیار ترکیبی داخلی دانست؛ نه نرخ قبولی در وظایف و نه میزان «کاملبودن» RSI.
بااینحال، این اعداد نشاندهنده تغییری هستند: پرسشی که پیشتر عمدتاً در آزمایشهای ذهنی مطرح میشد، در آزمایشگاههای پیشرو بهتدریج به قابلیتهای پژوهشی قابلاندازهگیری تجزیه میشود.
پژوهشگران طی چهل سال، فرایندهای بیشتری از بهبود را بهتدریج به ماشینها سپردهاند. این مقاله ابتدا چند قابلیت را که اغلب با یکدیگر اشتباه گرفته میشوند روشن میکند و سپس پنج «پیشرفت مرزی» را بررسی میکند تا ببینیم کدام حلقههای محدود از حرکت بازایستادهاند، چرا هنوز به معنای «انفجار هوش» نیستند و چرا نحوه بستهشدن حلقه از بستهشدن یا نشدن آن مهمتر است. این پنج پیشرفت فقط چارچوبی روایی برای دستهبندی تاریخ هستند، نه نسلبندی فناوری که همه آن را پذیرفته باشند. از نظر زمانی همپوشانی دارند و امروزه نیز همزمان توسعه مییابند.
RSI چیست: از خودبهبودی تا دستاوردهای بازگشتی
همه این خبرها درباره «خودبهبودی» هستند، اما توضیح نمیدهند که یک حلقه بسته چه زمانی کامل محسوب میشود.
در معنای سنتی، خودبهبودی بازگشتی (RSI) به سامانهای از هوش مصنوعی گفته میشود که از تواناییهای فعلی خود برای بهبود سازوکارهای شناختیای استفاده میکند که آن تواناییها را پدید آوردهاند. سپس سامانه بهبودیافته در دور بعدی بهبود مشارکت میکند. نکتهای که بیش از همه موجب سردرگمی میشود این است که توانایی خودبهبودی با توانایی شتاببخشیدن به خود برابر نیست. یک سامانه ممکن است در حل مجموعهای ثابت از پرسشها بهتر شود، بیآنکه در طراحی دور بعدی آموزش مهارت بیشتری پیدا کند. یک شرکت نیز ممکن است با استفاده گسترده از عاملها، پژوهش و توسعه را سرعت ببخشد، اما به اثر مرکبی که خودِ بهبودها ایجاد میکنند نرسد.
این مفهوم تازه نیست. در سال 1863، ساموئل باتلر تصور کرد که ماشینها از طریق تکامل تکرارشونده از انسانها پیشی میگیرند. در سال 1950، تورینگ پیشنهاد ساخت یک «ماشین کودک» را مطرح کرد که بتوان آن را آموزش داد و خودش را تغییر دهد. تا سال 1965، آی. جی. گود اشاره کرد که اگر «طراحی ماشینهای بهتر» نیز به هوش نیاز داشته باشد، ماشینی بهاندازه کافی هوشمند میتواند جانشینان قدرتمندتری طراحی کند؛ آنها هم به بهبود خود ادامه دهند و در نهایت «انفجار هوش» رخ دهد.
نکته کلیدی این نیست که آیا هوش مصنوعی در بهبودها مشارکت میکند یا نه، بلکه این است که آیا سامانه بهبودیافته در بهبود خودش بهتر میشود یا خیر. برای روشنکردن این مرز، میتوان RSI را به چهار معیار قابلمشاهده تقسیم کرد که از سادهترین تا دشوارترین مرتب شدهاند.
این مقاله از چارچوب زیر استفاده میکند. این تنها تعریف معیار در دانشگاهها نیست، اما هدف آن تفکیک ادعاهایی است که اغلب با هم خلط میشوند:
بهبود مستمر: تغییرات مؤثر میتوانند در وزنها، حافظه، ابزارها یا فرایندهای آموزشی ثبت شوند و پس از یک پاسخ ناپدید نشوند. وزنها که پارامتر نیز نامیده میشوند، مجموعه اعدادی هستند که مدل در طول آموزش پیوسته تنظیم میکند و در نهایت ذخیره میشوند. تحقق این معیار برای بحث درباره خودبهبودی ضروری است؛ در این مقاله، این اصطلاح به بهبود خروجی، حافظه، پارامترها یا ابزارها اشاره دارد.
حلقه بسته خودمختار: سامانه میتواند مشکلات را شناسایی کند، تغییراتی پیشنهاد دهد، آزمایش انجام دهد، نتایج را ارزیابی کند و در محدودههای تعریفشده نسخههای بهتر را بپذیرد. نسخه جدید میتواند در همین محدوده در دور بعدی بهبودها شرکت کند؛ چیزی که در این مقاله RSI محدود نامیده میشود.
دستاوردهای بازگشتی (که «جرقه» نیز نامیده میشود): نسخه جدید نهتنها در وظایف امتیاز بالاتری میگیرد، بلکه در تولید بهبود بعدی نیز از نسخه قبلی بهتر است. تنها با عبور از این مرز است که «توانایی بهبود بهخودیخود» شروع به انباشتهشدن میکند؛ در این مقاله از آن با عنوان خودشتابدهی بازگشتی یاد میکنیم.
استحکام و کنترلپذیری: دستاوردها با منابع ثابت و ارزیابیهای پنهان پایدار میمانند و به وظایف دیدهنشده تعمیم پیدا میکنند، بیآنکه با هزینه آلودگی ارزیابی، پیچیدگی مهارنشده سامانه، افت همراستایی یا نبود امکان ممیزی همراه باشند. (همراستایی یعنی اطمینان از اینکه رفتار هوش مصنوعی با خواستهها و محدودیتهای انسانی سازگار است، نه صرفاً رسیدن به امتیازی بالا.) برای نزدیکشدن به RSI باز، باید هر چهار معیار برآورده شوند.
درحالحاضر، دو معیار نخست پدیدار شدهاند، شواهد عمومی کافی برای معیار سوم وجود ندارد و معیار چهارم همچنان حلنشده است. وجود حلقههای بسته محدود به این معنا نیست که خودشتابدهی بازگشتی آغاز شده باشد. تنها بازخورد بازگشتیای که برای جبران افزایش دشواری پژوهش، طولانیترشدن چرخههای تکرار و دیگر موانع کافی باشد، به بهبودها امکان میدهد وارد محدوده خودتقویتشونده شوند.
در ادامه، چهار اصطلاح را بهطور ثابت به کار میبریم. خودبهبودی به بهبود خروجی، حافظه، پارامترها یا ابزارها اشاره دارد. اگر نسخه جدید بتواند در محدودههای ثابت در دور بعدی بهبود شرکت کند، آن را RSI محدود مینامیم. اگر سامانه بهبودیافته در بهبود خودش بهتر شود، به آن خودشتابدهی بازگشتی میگوییم که همان «جرقه» لایه سوم است. اگر این دستاورد بتواند پایدار بماند، تعمیم پیدا کند و از مرزهای وظیفه اولیه عبور کند، به RSI باز نزدیک میشود.
درحالحاضر، دو لایه نخست پدیدار شدهاند، شواهد عمومی کافی برای لایه سوم وجود ندارد و لایه چهارم همچنان حلنشده است. وجود حلقههای بسته محدود به این معنا نیست که خودشتابدهی بازگشتی آغاز شده باشد. تنها بازخورد بازگشتیای که برای جبران افزایش دشواری پژوهش، طولانیترشدن چرخههای تکرار و دیگر موانع کافی باشد، به بهبودها امکان میدهد وارد محدوده خودتقویتشونده شوند.
برای اینکه روشن شود امروز به کدام لایه رسیدهایم، باید به هوش مصنوعیای برگردیم که در سال 1981 یاد گرفت «تقلب» کند.
RSI چیست: از خودبهبودی تا دستاوردهای بازگشتی
در سال 1981، داگلاس لنات سامانهای به نام EURISKO ساخت. این سامانه نهتنها با استفاده از قواعد ابتکاری مسئله حل میکرد، بلکه قواعد جدیدی نیز تولید، اصلاح و ارزیابی میکرد و حتی این سازوکار را روی خودش به کار میگرفت. این کار برای زمان خود بسیار پیشرفته بود.
EURISKO در مسابقات قهرمانی ملی Traveller TCS، یک رقابت شطرنج فضایی، شرکت کرد. این سامانه ناوگان طراحی میکرد، نبردها را شبیهسازی میکرد و راهبردهایش را بر اساس شکستها تغییر میداد. در سال 1981 قهرمان شد و پس از آنکه برگزارکنندگان قوانین را تغییر دادند، در سال 1982 نیز دوباره برنده شد. جامعه هوش مصنوعی بهتزده شد: این سامانه واقعاً میتوانست خودش را بهبود دهد!
اما لنات خیلی زود با مسئلهای دشوارتر روبهرو شد.
EURISKO دریافت که افزایش قابلیتهای واقعی تنها راه کسب امتیاز بالا نیست. یک قاعده، بدون آنکه کشف مهمی انجام دهد، یاد گرفت وقتی قواعد دیگر به کشفی میرسند نام خود را در فهرست «کاشفان» ثبت کند و به این ترتیب، امتیاز «سودمندی» داخلیاش بهسرعت به حداکثر نزدیک شد. بهبیان دیگر، هوشمندتر نشده بود؛ بلکه یاد گرفته بود از حفرههای سازوکار ارزیابی سوءاستفاده کند.
امروزه این پدیده معمولاً «هک پاداش» نامیده میشود: سامانه حفرههایی پیدا میکند تا امتیازش را بالا ببرد، بیآنکه واقعاً به اهداف موردنظر طراح دست یابد. در زمینه خودبهبودی هوش مصنوعی، این مسئله بهویژه مرگبار است: وقتی سامانه هم موضوع بهبود باشد و هم بتواند بر فرایند ارزیابی اثر بگذارد، خودبهبودی ممکن است به خودفریبی تبدیل شود. در ادامه بارها با این دام روبهرو خواهیم شد.
در دهههای پس از آن، الگوریتمهای ژنتیک، راهبردهای تکاملی و تکامل شبکههای عصبی بارها نشان دادند که جستوجو و انتخاب میتوانند رفتارهای پیچیدهای ایجاد کنند؛ اما همواره همان مشکل را نیز آشکار کردند: تا وقتی اهداف ارزیابی حفره داشته باشند، سامانه ممکن است ابتدا یاد بگیرد از آن حفرهها استفاده کند، نه اینکه واقعاً قویتر شود.
این مسیر تا سال 2017 ادامه یافت؛ زمانی که نمونهای حتی افراطیتر پدیدار شد: AlphaZero از DeepMind. این سامانه بازی گو، شطرنج و شوگی را از صفر و با خودبازیکردن محض آموخت و برای نخستین بار قدرت «آموزش خود با دادههایی که خودش تولید کرده است» را به نمایش گذاشت.
بر اساس چارچوب چهارلایه این مقاله، AlphaZero نمونهای محدود از پیادهسازی است: خودبازی سیگنالهای آموزشی تولید میکند، بهبودها در وزنها ثبت میشوند و دو لایه نخست در محدوده یک بازی ثابت شکل گرفتهاند.
بااینحال، محدودیت اصلی این است که مرزهای حلقه بسته را انسانها تعیین میکنند و سامانه نمیتواند خودِ این مرزها را تغییر دهد. توابع پاداش (امتیاز برد)، قوانین بازی، فرایندهای آموزش و روشهای ارزیابی همگی از پیش توسط انسانها تعیین شدهاند. AlphaZero در محیطی کاملاً بسته و محدود به بازی، به حلقه بستهای از خودبهبودی مستمر و خودمختار رسید، اما نمیتوانست آن محیط را زیر سؤال ببرد یا تغییر دهد. در نتیجه، بهبودهایش برای همیشه به بُعد «بهترشدن در شطرنج» محدود میمانند و هرگز نمیتوانند از محیط بازی فراتر بروند.
این سقف مشترک روشهای تاریخی است. پژوهش در دوران LLM از آن عبور نکرده، اما آغاز کرده است که عناصر تحت کنترل انسان را یکییکی وارد حلقه بسته کند. نخستین عنصری که واگذار شد، سیگنال بازخوردی بود که مشخص میکند «چه چیزی به بهبود نیاز دارد».
پیشرفت نخست (2022--2023): آموزش هوش مصنوعی از اشتباهات خودش
همه روشهای تاریخی در یک نقطه متوقف شدهاند: جهت بهبود را انسانها از پیش تعیین میکنند. EURISKO و AlphaZero به توابع ارزیابی تعریفشده توسط انسان متکی بودند و الگوریتمهای ژنتیک نیز به توابع برازندگی طراحیشده توسط انسان وابسته بودند. سامانهها میتوانند تکامل پیدا کنند، اما فقط در مسیرهایی پیش میروند که انسانها تعیین کردهاند. برای پیشروی، نخست باید پرسید: آیا سامانه میتواند بدون دخالت انسان کیفیت خروجی فعلی خود را بسنجد و مسیرهایی برای بهبود تولید کند؟ در این مقاله، این بازخوردی که مسیر تغییر بعدی را نشان میدهد «سیگنال بهبود» نامیده میشود.
پیش از این، چنین کاری ممکن نبود، چون ماشینها نمیتوانستند بفهمند «پاسخ خوب چه ویژگیهایی دارد». در نیمه دوم سال 2022، مدلهای زبانی بزرگ (LLM) توانایی درک زبان و ارزیابی کیفیت یک متن را پیدا کردند. استفاده از بازخورد زبانی تولیدشده توسط خود سامانه، برای نخستین بار به روشی عمومی تبدیل شد. محدودیت اصلی این مسیر آن است که در تمام فرایند هیچ پارامتری تغییر نمیکند؛ بهبودها عمدتاً در فرایند استدلال و حافظه بیرونی رخ میدهند.
Reflexion: تبدیل بازبینی شکستها به حافظهای قابلاستفاده دوباره
سادهترین رویکرد این است که از مدل بخواهیم پاسخهایش را در لحظه اصلاح کند: ابتدا پاسخی بدهد، سپس همان پاسخ را نقد کند، بعد آن را بازنویسی کند و این چرخه را بدون تغییر پارامترها تکرار کند. اما این کار نقصی ذاتی دارد. نقدکردن خروجی خود با همان مدل، مثل اندازهگیری یک تکه پارچه با همان خطکش است و شناسایی نقاط کور را دشوار میکند. اگر فرایند بازبینی در همان زمینه فعلی محدود بماند، هر پیشرفتی پس از پایان وظیفه از بین میرود.
Reflexion (NeurIPS'23) یک عنصر طراحی مهم اضافه میکند: حافظه موقعیتی. پس از شکست در یک وظیفه، مدل گزارشی پس از رویداد را به زبان طبیعی مینویسد و آن را برای مراجعه در آینده ذخیره میکند. هنگام مواجهه با وظایف مشابه، این زمینه را مستقیماً به مدل میدهد. این کار مانند دادن دفترچهای از اشتباهات به هوش مصنوعی است. هرچه اشتباهات بیشتری جمع شوند، نقطه شروع تلاش بعدی بالاتر میرود.
در آزمون برنامهنویسی پایتون HumanEval، دقت pass@1 در Reflexion به %91 رسید و از بهترین نتیجه قبلی ذکرشده در مقاله، یعنی GPT-4 (%80)، فراتر رفت. pass@1 نشان میدهد چه نسبتی از مسائل پس از یک فرایند کامل پاسخگویی قبول میشوند؛ یعنی برنامه نهایی آزمونهای واحد پنهان را میگذراند. در تمام این فرایند، پارامترهای مدل بدون تغییر باقی ماندند.
نخستین مرز پیشرفت: حافظه میتواند ماندگار باشد، اما قابلیتهای پایه هنوز نسخه جدیدی نساختهاند.
حافظه موقعیتی Reflexion میتواند اطلاعات را میان وظایف حفظ کند و ازاینرو تا حدی شرط «بهبود ماندگار» را برآورده میسازد. بااینحال، چیزی که ذخیره میشود حافظه متنی بیرونی است، نه پارامترهای مدل، و مدل جدیدی با قابلیتهای پایه قویتر ایجاد نمیکند. با حذف حافظه، توانایی به حالت اولیه برمیگردد.
خلاصه اینکه این گام دفترچهای از اشتباهات در اختیار هوش مصنوعی میگذارد که میتوان آن را ذخیره کرد، اما تجربه هنوز درونی نشده است. برای پیشروی، باید بهبودها در پارامترها ثبت شوند تا نسخهای واقعاً جدید شکل بگیرد.
پیشرفت دوم (2022--2024): آموزش خود با دادههای تولیدشده توسط خودش
هدف این است که دفترچه اشتباهات در هسته مدل جا بگیرد. مسئلهای که این پیشرفت باید حل کند، این است: سیگنالهای بهبودی که خود مدل تولید میکند باید در پارامترها ثبت شوند تا تقویت قابلیتها واقعاً ماندگار شود. بدون این گام، ساختار بازگشتیای که در آن «نسخههای بعدی از نسخههای قبلی قویترند» شکل نمیگیرد و در نتیجه RSI هم وجود نخواهد داشت.
ایده ساده است: مدل یک مجموعه داده آموزشی تولید کند و سپس با استفاده از آن دوباره آموزش ببیند. شاید کمی شبیه «با پاگذاشتن روی پای خودش به آسمان برسد» به نظر برسد؛ اینکه آیا واقعاً شدنی است، موضوعی است که این گام میخواهد بررسی کند.
این نخستین بار است که مدلهای زبانی بزرگ بهصورت نظاممند به بهبود ماندگار در سطح وزنها میپردازند.
STaR: کار بنیادین در استدلال خودراهانداز
در سال 2022، STaR (Self-Taught Reasoner) (NeurIPS'22) به مدل امکان داد فرایندهای استدلالی تولید کند، بخشهای درست پاسخها را برای تنظیم دقیق نگه دارد و سپس از مدل بهروزشده برای تولید دسته بعدی فرایندهای استدلال استفاده کند.
مشکل این است که اگر مدل در ابتدا به همهچیز پاسخ اشتباه بدهد، چرخه نمیتواند آغاز شود.
راهکار STaR «استدلال معکوس» نام دارد: ابتدا پاسخ درست را به مدل میگویند و از آن میخواهند مسیر حل مسئله را برای آموزش استنتاج کند. این کار مانند روشنکردن چراغ اتاقی تاریک است تا مدل راهرفتن را یاد بگیرد؛ سپس چراغ را خاموش میکنند تا خودش مسیر را پیدا کند.
SPIN: بهبود مدل از طریق مقایسه با نسخههای تاریخی
آستانه فیلتر STaR ثابت است، اما SPIN (Self-Play Fine-Tuning) (ICML'24) به مدل فعلی امکان میدهد با نسخههای تاریخی رقابت کند و تفاوت بین «نمایشهای انسانی» و «خروجی نسخههای تاریخی» را بیاموزد. هرچه تشخیص تفاوت این دو دشوارتر باشد، مدل به نمایشهای انسانی نزدیکتر است و به برچسبگذاری دستی بیشتری نیاز ندارد.
مرز دومین پیشرفت: وزنها تغییر کردهاند، اما اهداف و خودکارهای قرمز همچنان در اختیار انسانها هستند.
این گام ماندگاری در سطح وزنها را حل میکند، اما سیگنالهای بازخورد همچنان به انسانها متکیاند. تابع پاداش را انسانها طراحی میکنند، وظایف آموزشی را انسانها انتخاب میکنند و معیارهای فیلتر داده را نیز انسانها تعیین میکنند. سامانه میتواند خودمختارانه دادههای پیشنهادی تولید کند، اما قضاوت درباره اینکه چه دادهای «خوب» است و ارزش آموزش دارد همچنان بر عهده انسانهاست. SPIN به برچسبگذاری دستی بیشتری نیاز ندارد، اما همچنان توزیع موجودِ نمایشهای انسانی را هدف میگیرد؛ بنابراین سقف آن نیز به همین توزیع وابسته میماند.
مسئله عمیقتر این است که دستاوردهای بازگشتی هنوز پدیدار نشدهاند: با بهبود قابلیتهای مدل، وظایف آموزشی ثابت بهتدریج چالشبرانگیزی خود را از دست میدهند. سامانه در تکمیل این دسته از مسائل توانمندتر میشود، اما مدرکی وجود ندارد که نشان دهد در طراحی خودِ آموزش نیز بهتر شده است. این مثل ورزشکاری است که در کمتر از 10 ثانیه دویده، درحالیکه مربی همچنان با معیارهای زنگ ورزش دبستان او را ارزیابی میکند؛ فضای بهبود را معیار ارزیابی محدود خواهد کرد.
خلاصه اینکه سامانه میتواند داده تولید کند و خودش به آن پاسخ دهد، اما هنوز نمیتواند عملکرد خودش را نمرهگذاری کند. تا وقتی آن خودکار قرمز در دست انسانها باشد، سقف را نیز انسانها تعیین میکنند.
پیشرفت سوم (2022--2025): سپردن اختیار بیشتر در امتیازدهی به هوش مصنوعی
آیا میتوان آن خودکار قرمز را هم به هوش مصنوعی سپرد؟ تا وقتی امتیازدهی و ارائه بازخورد به برچسبگذاری دستی یا اعتبارسنجهای نوشتهشده توسط انسان متکی باشد، جهت بهبود همچنان در دست انسانها میماند. اعتبارسنج در اینجا برنامهای است که میتواند بر اساس قواعد ازپیشتعیینشده، درستی نتایج را بهطور خودکار تشخیص دهد. هدف پیشرفت سوم کاهش این وابستگی است: آیا هوش مصنوعی میتواند سیگنالهای بازخورد بیشتری را خودش تولید کند؟
این مرحله تعمیق حلقه بسته خودمختار است: نهفقط مدل را به بازاندیشی درباره خروجی خود وادار میکند، بلکه بخشی از بازخورد آموزشی را نیز به هوش مصنوعی میسپارد.
از CAI تا Meta-Rewarding: از ارزیابی پاسخها تا ارزیابی داوران
هسته اصلی پیشرفت سوم، جهشی سهمرحلهای در پاسخ به این پرسش است که «چه کسی امتیاز میدهد؟»
جهش نخست: در سال 2022، Anthropic هوش مصنوعی مبتنی بر اصول (CAI) را پیشنهاد کرد. انسانها مجموعهای از اصول متنی را مینویسند و سپس هوش مصنوعی بر مبنای آنها امتیاز میدهد. در آزمایشها، اثربخشی این روش تفاوت چشمگیری با آموزش امتیازدهیشده توسط انسان نداشت و انسانها دیگر لازم نبود در امتیازدهی تکتک موارد مشارکت کنند.
جهش دوم: در سال 2024، Self-Rewarding Language Models از Meta (ICML'24) یک گام فراتر رفت. یک مدل هم پاسخها را مینویسد و هم به خودش و پاسخهای پیشنهادی دیگر امتیاز میدهد و از این امتیازها برای بهروزرسانی خود استفاده میکند. روش تنظیم دقیقی که به کار میبرد Direct Preference Optimization (DPO) نام دارد و میتوان آن را ساده اینطور فهمید: «این پاسخ از آن یکی بهتر است، پس در آینده بیشتر به سمت پاسخ بهتر متمایل شو.»
مدل Llama 2 70B پس از سه دور تکرار، نرخ برد خود را در AlpacaEval 2.0 از %9.94 به %20.44 افزایش داد. در اینجا GPT-4 نقش داور و GPT-4 Turbo نقش رقیب را دارد؛ این نرخ برد با نرخ معمول صحت پاسخها یکسان نیست.
جهش سوم: اگر کیفیت پاسخها بتواند تکامل پیدا کند، آیا کیفیت قضاوتها نیز میتواند تکامل پیدا کند؟ Meta-Rewarding (2024) بر همین مبنا لایهای از «فراقضاوت» اضافه میکند. یک مدل همزمان در نقش پاسخدهنده، داور و «داورِ داور» ظاهر میشود. نقش سوم بهطور ویژه بررسی میکند که آیا امتیازدهی دقیق است یا نه. در هر دور بهروزرسانی، مدل همزمان به سمت «پاسخدهندهای بهتر» و «داوری دقیقتر» پیش میرود.
بااینحال، مقاله به پدیدهای نگرانکننده نیز اشاره میکند: پس از چند دور تکرار، «داورِ داور» شروع به افت میکند. دیگر بررسی نمیکند کدام امتیازدهی منطقیتر است، بلکه مستقیماً گزینهای را انتخاب میکند که امتیاز بالاتری دارد و باعث انحراف معیارهای ارزیابی میشود. این پدیده یادآور مشکل قدیمی EURISKO در نسخه 2024 آن است: هرچه تکامل عمیقتر میشود، خطکشی که خوب و بد را با آن میسنجیم کجتر میشود.
مرز پیشرفت سوم: وقتی خودکار قرمز به هوش مصنوعی سپرده میشود، خطکش نیز شروع به خمشدن میکند.
این گام وابستگی سیگنالهای بازخورد به برچسبگذاری دستی را بهشدت کاهش میدهد، اما همزمان مسئله اصلی RSI را آشکار میکند: وقتی ارزیاب و ارزیابیشونده نقاط کور مشترکی دارند، حلقه بسته بهآسانی خودش را تأیید میکند.
چنین سامانههایی میتوانند بهروزرسانیهای ماندگار و خودمختار ایجاد کنند، اما لزوماً از پس وظایف جدیدی که با دادههای آموزشی تفاوت دارند برنمیآیند و مدرکی هم وجود ندارد که نسخههای جدید به بهبوددهندگانی قویتر تبدیل شوند. مسئله از «بازخورد انسانی بیش از حد کند است» به «آیا خودارزیابی قابلاعتماد است؟» تغییر میکند.
خلاصه اینکه خودکار قرمز سرانجام در دست هوش مصنوعی است، اما همین که آن را در دست میگیرد، شروع میکند به دادن امتیازهای بالا به خودش.
پیشرفت چهارم (2023--2026):
امکان تغییر روشهای عملکرد به هوش مصنوعی
سه پیشرفت نخست عمدتاً بر تغییر خروجیها، حافظه، پارامترها و سیگنالهای بازخورد تمرکز داشتند. اما قابلیتهای یک سامانه هوش مصنوعی تنها به پارامترهایش بستگی ندارد؛ بلکه کل سامانه کنترلی پیرامون عملکرد مدل نیز اهمیت دارد: درخواستها چگونه نوشته میشوند، چه ابزارهایی فراخوانی میشوند، فرایندها چگونه چیده میشوند، حافظهها کجا ذخیره میشوند، چه مجوزهایی داده میشود و نتایج چگونه ارزیابی میشوند.
لیلیان ونگ در مقالهای مفصل در سال 2026، کل این لایه را harness نامید. این لایه مانند یراق اسب است؛ هم از کار مدل پشتیبانی میکند و هم محدود میکند که مدل کجا، چگونه و تا چه اندازه میتواند پیش برود. harness تعیین میکند که آیا قابلیتهای مدل میتوانند به اقداماتی قابلاعتماد تبدیل شوند یا نه.
احتمالاً خودبهبودیهای اخیر از harness آغاز میشوند؛ زیرا تغییر وزنها پرهزینه است، بازخورد کند میرسد و خطرها زیادند، درحالیکه تغییر harness در اصل به معنای اصلاح کد است و ارزانتر و بازگشتپذیرتر است. مسیر بلندمدت ممکن است تکامل همزمان وزنهای مدل و harness باشد، اما ارزیابها، کنترل مجوزها و مرزهای کلیدی ایمنی باید بیرون از محدوده تکامل باقی بمانند.
بنابراین، پرسشی که پیشرفت چهارم میخواهد پاسخ دهد این است: آیا سامانه میتواند harness خود را بهطور خودمختار تغییر دهد؛ یعنی معماری عملکرد خودش را تعیین کند؟
بهروزرسانی پارامترها با روش عملکردی ازپیشتعیینشده انجام میشود تا قابلیتها در مدل درونی شوند. بهروزرسانی harness نحوه بهکارگیری قابلیتها را عوض میکند؛ درست مثل بازطراحی میز کار، جعبهابزار و روشهای آموزشی.
بهبود harness نردبانی مرحلهبهمرحله و روشن دارد. موضوعات بهینهسازی از سطحی به عمیق حرکت میکنند و هر سطح به هسته «نحوه تفکر سامانه» نزدیکتر میشود:
flowchart LR
A["بازنویسی
درخواست"] --> B["ساختار زمینه
چه چیزی ارائه شود"]
B --> C["گردشکار
تغییر مراحل"]
C --> D["کد Harness
تغییر کل چیدمان"]
D --> E["کد بهینهساز
تغییرِ «چگونگی تغییر»"]
هرچه به لایههای درونیتر میرویم، اهرم تغییرات بزرگتر و فاصله تا «بازنویسی منطق عملیاتی خود سامانه» کمتر میشود. اکنون این نردبان را از سطحیترین تا عمیقترین مرحله بهترتیب بررسی میکنیم.
OPRO: امکان تکرار و بهبود درخواستها توسط خودشان
آیا تغییر ساده درخواستها، یعنی دستورهایی که به مدل میدهیم، میتواند سامانه را قویتر کند؟ OPRO (ICLR 2024) رویکردی نمونه ارائه میدهد. این روش درخواستهایی را که مدل امتحان کرده، همراه با امتیازهایشان در اختیار مدل میگذارد تا الگوها را استنتاج کند و نسخههای بهتری بسازد. کاری که پیشتر به آزمون مکرر «تغییر جزئی عبارتبندی» توسط انسان نیاز داشت، اکنون میتواند توسط خود مدل تکرار شود.
بااینحال، سقف این روش روشن است: درخواستها هرقدر هم خوب باشند، فقط قابلیتهای موجود مدل را به کار میگیرند و نمیتوانند توانایی جدیدی ایجاد کنند.
ADAS و AFlow: طراحی خودکار گردشکار عاملها
یک لایه عمیقتر، هدف بهینهسازی دیگر فقط عبارتبندی نیست، بلکه چگونگی چیدمان اطلاعات ورودی مدل و کل فرایند انجام وظیفه نیز هست. برای نمونه، AI Scientist مراحل «پیشنهاد ایده ← نوشتن کد ← اجرای آزمایش ← نوشتن مقاله ← داوری همتا» را در قالب یک خط لوله به هم پیوند میدهد. ازآنجاکه میتوان این فرایند را با کد نوشت، میتوان آن را جستوجو و بهینهسازی هم کرد.
ADAS (ICLR 2025) خودِ «طراحی گردشکار» را به مسئلهای برای بهینهسازی تبدیل میکند. یک «عامل طراح» در سطحی بالاتر پیوسته گردشکارهای جدیدی را با کد مینویسد و آنها را در چرخهای اجرا، فیلتر و اصلاح میکند.
AFlow (ICLR 2025) حتی یک گام فراتر میرود. این روش گردشکارها را به شکل نمودارهای جریانی متشکل از فراخوانی مدل و داوریهای منطقی نمایش میدهد، سپس با الگوریتمهای جستوجو ساختارهای بهتری پیدا میکند و در نهایت از راهحلهای طراحیشده بهصورت دستی پیشی میگیرد.
Self-Harness و DGM: امکان بازنویسی کد Harness توسط سامانه
در بالاترین پله نردبان، سامانه مستقیماً کدی را بازنویسی میکند که نحوه عملکرد آن را تعریف میکند. در اینجا دو مسیر وجود دارد.
مسیر نخست «پیشنهاد، ارزیابی، پذیرش» است. سامانه مشکلات خودش را شناسایی میکند، تغییراتی پیشنهاد میدهد و پس از تأیید اثربخشی آنها، تغییرات را میپذیرد.
Self-Harness (2026) معیارهای سختگیرانهای برای پذیرش معرفی میکند: سامانه ابتدا دلایل شکست را خلاصه میکند و سپس تغییرات کوچک و بازگشتپذیر اعمال میکند. نسخه جدید فقط وقتی حفظ میشود که عملکرد آن در برابر مشکلات دیدهشده و دیدهنشده افت نکند.
مسیر دوم جستوجوی تکاملی است. سامانه گروهی از راهحلهای پیشنهادی را حفظ میکند، به آنها اجازه میدهد گونههای تازه بسازند و سپس نسخههای بهتر را با آزمایش انتخاب میکند.
Darwin Gödel Machine (DGM) (2025) مستقیماً کد خودتغییردهنده ابزارهایش را تکامل میدهد. با ثابتماندن مدل پایه، نرخ موفقیت آن در تعمیرهای SWE-bench Verified از %20 به %50 افزایش یافت.
بینش مشترک پشت این دو مسیر این است که کد زبان عمومی تعریفکننده سامانه است. وقتی ابزارها به شکل کدی اجرایی و امتیازپذیر نوشته شوند، عاملهای برنامهنویس میتوانند در این فضای طراحی جستوجو کنند.
MetaClaw و AgentX: تبدیل کاربران واقعی به منبعی برای بازخورد
صرفنظر از مسیری که انتخاب میشود، تکامل خود ابزارها به سیگنالهایی نیاز دارد که نشان دهند «تغییرات تا چه اندازه خوب انجام شدهاند».
سیگنالهای بهبود DGM از یک مجموعه آزمون ثابت میآیند. MetaClaw (2026) به عاملها امکان میدهد تجربههای بهدستآمده از استقرارهای واقعی را از گفتوگوها استخراج کنند و این تجربهها را در پسزمینه به وزنها تبدیل کنند؛ به این ترتیب، محرک تکامل از مجموعه پرسشها به کاربران تغییر میکند.
در صنعت، برخی این مسیر را در کسبوکار واقعی پیادهسازی کردهاند. AgentX شرکت Kuaishou (2026) سوابق اجرا را بررسی میکند تا ابزارهای عاملهای فرعی را تغییر دهد و نسخههای جدید را بر اساس وظایف تاریخی انتخاب کند.
این سامانه از چارچوبی مشابه «پیشنهاد، ارزیابی، پذیرش» در Self-Harness استفاده میکند. تفاوت این است که در نهایت باید آزمون واقعی آنلاین A/B را پشت سر بگذارد. تعامل کاربران و رفتار مصرف آنها به سیگنالهای پاداش سامانه تبدیل میشوند.
تفاوت اساسی این روشها نه در سازوکارها، بلکه در مربی است: مجموعه آزمون، کاربران واقعی یا کسبوکار آنلاین. هرچه مربی به واقعیت نزدیکتر باشد، احتمال مفیدبودن واقعی بهبودها بیشتر میشود، اما خطر سوءاستفاده نیز افزایش مییابد.
مرز پیشرفت چهارم: معماری عملکرد را میتوان تغییر داد، اما مرزهای راستیآزمایی و اهداف نهایی همچنان بیرونی میمانند.
این پیشرفت روشهای فراخوانی مدلها، ابزارها و حافظهها را نیز به موضوعاتی تکاملپذیر تبدیل کرده است. بااینحال، جهت تکامل ابزارها همچنان توسط وظایف بیرونی، اعتبارسنجها یا اهداف کاربران تعیین میشود. مهمتر از همه اینکه امتیاز بالاتر ابزارها به معنای هوش پایه قویتر نیست. ممکن است سامانه ابزارهایش را تغییر دهد، اما این به معنای آن نیست که بتواند از ابزارهای بهروزشده بهطور مؤثر استفاده کند.
خلاصه اینکه سامانه سرانجام میتواند اندامها و میز کار خودش را تغییر دهد، اما معیارهای پذیرش و مرزهای ساخت را همچنان دنیای بیرون تعیین میکند.
پیشرفت پنجم (2025-2026):
قرار دادن فرایند یادگیری و پژوهش در یک حلقه بسته
تغییر ابزارها یک مسیر است، اما ابزارها نحوه اجرای وظایف توسط سامانه را هنگام عملکرد تغییر میدهند: اینکه کدام ابزارها فراخوانی شوند، چه فرایندی دنبال شود و چه زمانی کار متوقف شود. پیشرفت پنجم لایهای بالادستیتر را تغییر میدهد: مواد و محیطهایی که برای یادگیری استفاده میشوند؛ منابع تمرینها، ماهیت محیط تمرین و نحوه تولید دادههای آموزشی. اولی تعیین میکند قابلیتهای موجود چگونه به کار گرفته شوند و دومی مشخص میکند نسخه بعدی مدل با چه نوع تجربههایی آموزش ببیند. بازههای زمانی این دو بهشدت همپوشانی دارند و گروههای زیادی هر دو را همزمان انجام میدهند، اما موضوع تغییر متفاوت است: یکی بر ساختار کنترلی هنگام استدلال اثر میگذارد و دیگری بر عرضه ورودی پیش از آموزش.
در نتیجه، مسیر دیگری آغاز میشود که دامنه حلقه بسته را گسترش میدهد: آیا کل فرایند یادگیری و پژوهش میتواند به موضوعی عملیاتی برای سامانه تبدیل شود؟ سامانه تولید مواد آموزشی، انتخاب راهبردهای تمرین، اجرای آزمایش، اصلاح فرایندهای آموزش و سپس ثبت نتایج در مدل یا ابزارها را آغاز میکند.
در اینجا باید از یک برداشت نادرست پرهیز کرد. تولید خودمختار داده یا محیط توسط سامانه فقط دامنه حلقه بسته خودمختار را گسترش میدهد. حتی اگر تولید پرسش، پاسخگویی و نمرهدهی همگی توسط هوش مصنوعی انجام شوند، تا وقتی نسخه جدید در طراحی دور بعدی بهبودها بهتر نشده باشد، سامانه هنوز از آستانه دستاوردهای بازگشتی عبور نکرده است.
SEAL: امکان تولید داده آموزشی و دستورالعملهای بهروزرسانی توسط مدلها
وقتی مدل با مطلب تازهای روبهرو میشود که پیشتر ندیده است، معمولاً فقط به شیوهای یاد میگیرد که انسانها از قبل تعیین کردهاند. اما پروژهای در سال 2025 به مدل امکان داد ابتدا «برنامه یادگیری» خودش را بنویسد: مطالب را چگونه سازماندهی کند، با چه سرعتی یاد بگیرد و آیا به بازنویسیهای متعدد نیاز دارد یا نه؛ همه اینها را خود مدل تعیین میکند و سپس پارامترهایش را بر اساس برنامه بهروزرسانی میکند. این کار مثل آن است که برای خودش برنامه کلاس بچیند و بعد در کلاسها شرکت کند.
این روش SEAL (Self-Adapting LLMs) (NeurIPS'25) نام دارد. کیفیت برنامه را میتوان با این پرسش سنجید که «پس از کلاس، عملکرد آن چقدر دقیق است؟» سپس سامانه از نتایج برای تنظیم برنامه استفاده میکند؛ یعنی یادگیری تقویتی.
در وظایف پرسشوپاسخ دانشی، این رویکرد دقت را از %33.5 به %47.0 افزایش داد و از استفاده مستقیم از GPT-4.1 برای تولید مطالب آموزشی بهتر عمل کرد.
SEAL مسئله «چگونه برای خودش مطالب آموزشی آماده کند» را حل میکند. اما برای عاملهایی که باید بارها با محیط تعامل کنند، بهسرعت گلوگاه دیگری پدیدار میشود: تمرین واقعی اغلب بیش از حد کند و پرهزینه است. بنابراین پروژه بعدی محیط را نیز وارد حلقه بسته میکند.
SEAL مسئله «چگونه برای خودش مطالب آموزشی آماده کند» را حل میکند. اما برای عاملهایی که باید بارها با محیط تعامل کنند، تمرین واقعی اغلب بیش از حد کند و پرهزینه است: محیطهای وب بیشازحد پیچیدهاند و هر عملیات باید در دنیای واقعی اجرا شود؛ درنتیجه گردآوری داده کند و پرهزینه است. WebEvolver (EMNLP'25) راهحلی میانه ارائه میدهد: آموزش یک «مدل جهان» درونی برای شبیهسازی واکنش وب، درست مثل ساختن محیطی محدود در ذهن. عاملها میتوانند با هزینهای اندک در این محیط بهطور گسترده تمرین کنند و فقط در گامهای حساس برای اعتبارسنجی آنلاین شوند؛ هنگام اجرای وظیفه نیز این محیط میتواند به پیشبینی نتایج عملیات بعدی کمک کند. در سه مجموعه آزمون وظایف واقعی وب، عملکرد کلی آن در مقایسه با عاملهای خودتکاملیاب فعلی حدود %10 بهتر شد و به مدل «معلم» قویتری متکی نبود.
در این مرحله، حلقه بسته میتواند در محیطی شبیهسازیشده تمرین کند. پرسش طبیعی بعدی این است: آیا پیشبینی، ارزیابی و بهروزرسانی پارامترها میتوانند بیرون از وب انجام شوند و حلقه را در دنیای فیزیکی واقعی ببندند؟
Motus2: ورود خودبهبودی پارامترها به دنیای فیزیکی
خودبهبودی فقط در زبان و کد رخ نمیدهد. در 08/2026، نرخ موفقیت میانگین یک سامانه رباتیک در دو وظیفه واقعی ماشینی از %65 به %75 افزایش یافت. این تغییر حاصل حلقه بستهای بسیار مشخص بود: ربات ابتدا چند اقدام را تصور میکند، پیامدهای هر اقدام را پیشبینی میکند، اقدامهای بهتر را برمیگزیند و سپس از نتایج برای دور بعدی آموزش استفاده میکند.
این سامانه Motus2 نام دارد. راهبرد، پیشنهاد اقدامها را بر عهده دارد؛ مدل جهان پیامدهای اقدامها را پیشبینی میکند و مدل ارزش میسنجد که آیا این پیامدها به تکمیل وظیفه کمک میکنند یا نه. پیشبینی و امتیازدهی هم برای انتخاب اقدامها و هم برای بهروزرسانی پارامترهای اقدام به کار میروند.
این یک بهبود راهبرد در سطح وزنهاست، اما همچنان حلقهای بسته و محدود باقی میماند: مدل جهان و مدل ارزش پایه ثابت هستند و اهداف وظیفه و نظارت همچنان از بیرون تأمین میشوند. مقاله نشان نمیدهد که Motus2 بهبودیافته در طراحی دور بعدی الگوریتمهای یادگیری بهتر عمل میکند. این پژوهش ثابت میکند که حلقه بسته میتواند روی رباتهای واقعی اجرا شود، نه اینکه RSI باز از پیش کامل شده باشد.
SEAL، WebEvolver و Motus2 مواد آموزشی، محیطهای تمرین و اقدامات فیزیکی را وارد حلقه بسته کردهاند. آنها دامنه عملیاتهایی را گسترش دادهاند که سامانه میتواند بهطور خودمختار انجام دهد، اما هنوز اختیار تصمیمگیری درباره «چه چیزی را پژوهش کند و چه زمانی نتایج را بپذیرد» به سامانه ندادهاند. برای دیدن میزان پیشرفت این مرز در پژوهش و توسعه واقعی، باید به آزمایشگاههای پیشرو و سامانههای تولید بازگردیم.
OpenAI و Google: مشارکتدادن عاملها در توسعه مدل
«کارآموز پژوهشی خودکار» OpenAI هماکنون میتواند عیبیابی کند، برنامههای کرنل GPU را بهینه کند، دستورالعملهای آموزشی را بیازماید و به بهبود مدلی دیگر کمک کند. Google نیز اعلام کرده است که عاملهای بلندمدت در اصلاح مدلهای زیربنایی مشارکت داشتهاند. بااینحال، هیچکدام از این دو شرکت حلقه بسته خودمختار کاملی را نشان ندادهاند: انسانها همچنان جهت پژوهش و پیشرفت نتایج به مرحله بعد را تعیین میکنند و اطلاعات عمومی برای بازسازی نحوه عملکرد حلقه کافی نیست.
تغییر واقعی این است که هوش مصنوعی از «مدلی که موضوع پژوهش است» به «مجریای که در پژوهش مدلها مشارکت دارد» گذر کرده است. وارد کارگاه آموزش شده، اما هنوز فرمان آزمایشگاه را در دست نگرفته است.
تابستان 2026: سامانههای پژوهشی خودکار شروع به بهبود روشهای پژوهشی خود میکنند
پنج پیشرفت نخست پیوسته «چیزهایی را که سامانه میتواند تغییر دهد» گسترش دادند. مجموعهای از پژوهشهایی که در تابستان 2026 پدیدار شدند، مستقیماً این پرسش را مطرح کردند: آیا میتوانیم سامانههای پژوهشی خودکار را وادار کنیم درباره خودِ سامانههای پژوهشی خودکار پژوهش کنند و آنها را بهبود دهند؟
در یک بنچمارک پیشآموزش GPT، حلقه درونی معمولی زیان اعتبارسنجی را حدود 0.009 کاهش داد، درحالیکه افزودن یک حلقه بیرونی میانگین کاهش را به حدود 0.045 رساند؛ یعنی بهبودی حدوداً پنجبرابری. زیان اعتبارسنجی را میتوان معیاری دانست از اینکه مدل در دادههای جدید تا چه اندازه «خطا میکند» و معمولاً هرچه کمتر باشد بهتر است. در اینجا مقایسه درباره میزان کاهش زیان است، نه اینکه دقت وظیفه پنج برابر شده باشد.
روش Bilevel Autoresearch که به این نتیجه رسید از دو لایه حلقه استفاده میکند: عامل درونی کد وظیفه را بهینه میکند و عامل بیرونی سازوکار جستوجوی عامل درونی را بهینه میکند. سامانه دیگر فقط پاسخها را بهبود نمیدهد، بلکه «روش پیدا کردن پاسخها» را نیز بهتر میکند.
Recursive Harness Self-Improvement (RHI) نیز نتایج مشابهی به دست آورد: در 30 وظیفه پژوهشی مصنوعی یادگیری ماشین، عامل بهروزشده با بودجه استنتاجی پایین از پیکربندی بهینهنشدهای که بیشترین بودجه را داشت پیشی گرفت و همزمان هزینه استنتاج را تا حدود %60 کاهش داد. بهبود سازوکارهای عملکردی گاهی از افزایش صرف بودجه تفکر مؤثرتر است.
بااینحال، این دو نتیجه عمدتاً از آزمایشهایی با مقیاس کنترلشده به دست آمدهاند. برای اثبات اینکه حلقه بسته فقط گاهی به راهحلی خوب نمیرسد، به عملکرد پیوسته طولانیتر، چند نسخه متوالی و آزمونهایی خارج از حلقه نیاز داریم. AIDE² تلاش میکند این سه جنبه را ترکیب کند.
بحث واقعی بر سر AIDE² شکل میگیرد. تیم Weco یک عامل پژوهشی خودکار را بهعنوان بهبوددهنده لایه بیرونی به کار گرفت تا ابزارهای AIDE درونی را طی 100 گام پیوسته بازنویسی کند. پس از هشت روز فعالیت بدون نظارت، سامانه هفت نسخه بهبودیافته متوالی را گزینش کرد. تیم گزارش داد که بهترین نسخه نهتنها از نقطه شروع بهتر عمل کرد، بلکه از نسخهای که بهصورت دستی طی دو سال تنظیم شده بود نیز پیشی گرفت و به وظایفی که حلقه هرگز با آنها روبهرو نشده بود تعمیم یافت.
تغییر دیگری نیز در تقلب پاداش رخ داد. در آزمون برنامه کرنل GPU موسوم به KernelBench که در بهینهسازی دخیل نبود، %63 از موارد نسخه آغازین نشان میدادند که «امتیازهای عمومی ظاهراً بهتر شدهاند، اما اعتبارسنجی پنهان آنها را تأیید نکرده است». بهترین نسخه تکاملیافته این نسبت را به %34 کاهش داد. امتیاز پنهان در اینجا امتیازی است که سامانه هنگام بهینهسازی نمیبیند و فقط در پذیرش نهایی استفاده میشود. شاید این امتیاز نسخههایی را حذف کرده باشد که فقط برای گرفتن امتیاز عمومی بهتر ساخته شده بودند.
Weco از این نتیجه با عنوان سطح 1: بهبود خالص مثبت یاد میکند. این اصطلاح معیار پذیرفتهشده صنعت نیست، اما درحالحاضر شواهدی از RSI محدود است که ارزش بررسی جدی دارد. مرزهای شواهد نیز روشناند: نتایج از گزارشهای خود تیم به دست آمدهاند و گزارش کامل هنوز منتشر نشده است. سامانه تکاملیافته همچنین افزایش پیچیدگی و کد مرده نشان داده است. از همه مهمتر، در آزمون جرقه سطح بعدی موفق نشده است: ثابت نشده که سامانه بهبودیافته در بهبود نسخهای دیگر از نسخه قبلی بهتر باشد.
در یک جمله: حلقه بسته توانسته چند بار در جهت مثبت بچرخد، اما هنوز ثابت نکرده است که چرخش بعدی بهواسطه چرخش قبلی سریعتر خواهد بود.
نگاه یکپارچه: چگونه مرحله فعلی RSI را تعیین کنیم
جدول زیر از چهار معیار مطرحشده در ابتدا (بهبود مستمر، حلقه بسته خودمختار، دستاورد بازگشتی، استحکام و کنترلپذیری) برای مقایسه پیشرفتهای قبلی و برجستهکردن شکافهای اصلی استفاده میکند. بخش زیادی از پژوهشهای مرتبط با حلقههای فراپژوهشی بسته، پیشچاپهای arXiv مربوط به ماههای اخیر سال 2026 هستند و AIDE² نیز نتیجهای از وبلاگ تیم است که خود تیم گزارش کرده و هنوز داوری همتا نشده است. این نتیجهگیریها را باید مشاهداتی مربوط به مرحله فعلی دانست، نه اجماعی تثبیتشده.
علامت ✅ در جدول نشاندهنده شواهد مستقیم است، ⚠️ یعنی فقط تحت شرایط محدود صدق میکند یا شواهد هنوز کافی نیستند و ❌ یعنی هنوز نشان داده نشده است.
تاریخ این حوزه، تاریخ حرکت تدریجی «موضوعاتی است که سامانه میتواند تغییر دهد» به سمت درون. موضوعات تغییر بهتدریج از خروجیها و حافظهها به پارامترها، قضاوتها، ابزارهای محرک و محیطهای آموزشی عمیقتر شدهاند و در نهایت به سازوکارهایی رسیدهاند که خودِ بهبودها را تولید میکنند.
هرچه عمیقتر میرویم، تعریف و اثبات «بهبود» دشوارتر میشود. اگر به چهار معیار برگردیم—بهبود مستمر، حلقه بسته خودمختار، دستاورد بازگشتی، استحکام و کنترلپذیری—موانع واقعی جرقهزدن و RSI باز در روزگار ما دقیقاً دشوارترین بخشهای سه معیار آخر هستند که میتوان آنها را به چهار مانعِ بههمپیوسته تقسیم کرد.
مانع نخست (آیا حلقه بسته خودمختار قابلاعتماد است؟): آیا اعتبارسنج قابلاعتماد است و آیا سامانه نمیتواند آن را تغییر دهد؟ وقتی سامانه هم بهبوددهنده باشد و هم ارزیاب، معیارهای ارزیابی با تکرارها منحرف میشوند. «داورِ داوران» در Meta-Rewarding بهتدریج به امتیازهای بالا گرایش پیدا کرده است و EURISKO هم پیشتر یاد گرفته بود نام خود را وارد دفتر ثبت اعتبار کند. هر دو یک نکته را به ما یادآوری میکنند: فرایند بهینهسازی به هر شکافی میان معیارها و اهداف واقعی حمله میکند.
منظور از لنگرهای بیرونی، ارزیابیها یا محدودیتهایی است که سامانه بهبودیافته نمیتواند آنها را دستکاری کند. اثباتهای رسمی، اعتبارسنجهای اجرایی و آزمونهای پنهان معمولاً از خودارزیابی مدل قابلاعتمادترند. امتیازهای پنهان AIDE² میتوانند بخشی از تقلب پاداش را کاهش دهند، دقیقاً به این دلیل که عاملهای درونی نمیتوانند آنها را دستکاری کنند.
اصل واقعاً قابلاعتماد این نیست که انسانها تکتک گامها را ممیزی کنند؛ بلکه ارزیابها و مرزهای اختیار باید بیرون از کنترل سامانه تکاملیافته باقی بمانند. وظایف ریاضی و کدنویسی میتوانند به اثباتگرها، کامپایلرها یا آزمونهای پنهان تکیه کنند. سلیقه پژوهشی، سلامت بلندمدت کد و مرزهای استقرار همچنان به داوری نهایی انسان نیاز دارند.
مانع دوم (استحکام و کنترلپذیری، بخش نخست): آیا بهبودها میتوانند از توزیع دادههای خودشان خارج شوند؟ آموزشدادن به خود با دادههای تولیدشده توسط خود، سوگیریهای موجود را تشدید میکند، تنوع را کاهش میدهد و در نهایت به فروپاشی مدل میانجامد: خروجیها بهتدریج یکنواختتر میشوند و خطاهای اولیه در دورهای خودآموزی بارها تقویت میشوند. تغییر ابزارهای محرک با استفاده از یک مجموعه پرسش ثابت ممکن است ویژگیهای همان مجموعه را وارد گردشکار کند و شکل دیگری از بیشبرازش ایجاد کند.
بهبود در یک وظیفه دیدهنشده بهتنهایی کافی نیست. سامانه باید از ارزیابیهای پنهان در وظایف، حوزهها و بازههای زمانی گوناگون سربلند بیرون بیاید تا ثابت کند قابلیتهای قابلانتقالی کسب کرده است، نه مهارتهای پنهان بیشتری برای امتحاندادن.
مانع سوم (خودِ دستاورد بازگشتی): آیا بهبود واقعاً دستاورد بازگشتی دارد؟ افزایش امتیاز وظایف به معنای بهترشدن سامانه در طراحی بهبود بعدی نیست. AIDE² چند گام بهبود خالص مثبت را نشان داد، اما از مرحله جرقه عبور نکرد. AI4AI-Bench نشان میدهد که بیشتر سامانهها هنوز الگوریتمهای یادگیری اصلی را تغییر نمیدهند. وقتی بنیان بیش از حد ضعیف باشد، کیفیت دادههای تولیدشده توسط خود و خودتشخیصی نیز ممکن است چرخه را بدتر کند.
مانع چهارم (استحکام و کنترلپذیری، بخش دوم): آیا قابلیتها، پیچیدگی و کنترل میتوانند همزمان گسترش پیدا کنند؟ قویترشدن لزوماً به معنای «فرمانبردارترشدن» نیست و توانایی بیشتر در تغییر کد لزوماً نگهداری از آن را آسانتر نمیکند. کد مرده و افزایش پیچیدگی در AIDE² هشداری در مقیاس کوچک هستند. در سامانههای آموزشی بزرگتر، هرچه اختیارات بیشتر و تکرارها سریعتر شوند، درک دقیق پیامدهای هر تغییر برای انسانها دشوارتر خواهد شد.
یاکوب پاچوکی، دانشمند ارشد OpenAI، علناً گفته است که هیچ آزمایشگاهی هنوز همراستایی و نظارت را تا حدی حل نکرده که بتواند در بلندمدت و با مسئولیتپذیری، با حداکثر سرعت مقیاسگذاری کند. هدف واقعی صرفاً بالا رفتن منحنی قابلیتها نیست؛ بلکه باید مطمئن شد ایمنی، نظارت، بازگردانی و قابلیت ممیزی دستکم همگام با آن افزایش مییابند.
AutoResearchEval، 800 مسیر پژوهشی واقعی را بررسی و 45 دسته از شکستها را خلاصه کرده است. نتیجه همه آنها به یک شکاف اشاره میکند: عاملهای فعلی فاقد حلقه فراشناختی پایداری هستند و نمیتوانند پیوسته نتیجهگیریها را با شواهد تطبیق دهند، هنگام بروز خطا بهشکلی قابلاعتماد به عقب برگردند یا مسیرهای پژوهشی خود را فعالانه زیر سؤال ببرند. حل این مشکل صرفاً با افزودن یک لایه دیگر از گردشکار ممکن نیست.
بنابراین، سناریوی واقعبینانه محتملتر این نیست که انسانها بهسادگی از حلقه بسته بیرون رانده شوند، بلکه این است که به سطوح بالاتری از نردبان انتزاع بروند: از نوشتن کد به راستیآزمایی کد، از اجرای آزمایشها به طراحی اعتبارسنجیها، از اجرای محلی به تصمیمگیری درباره اینکه چه چیزی ارزش پژوهش دارد، چه شواهدی برای پیشبرد کار کافی است و چه زمانی باید متوقف شد. هرچه ماشینها کارهای بیشتری را بر عهده بگیرند، چیزی که برای انسانها باقی میماند اختیار اجرایی هر گام نیست، بلکه تعیین اهداف، مرزهای اعتبارسنجی و حق وتوی نهایی است.
جمعبندی: حلقه بسته خودبهبودی پدیدار شده است، اما دستاورد بازگشتی هنوز به اثبات نیاز دارد
از EURISKO که در سال 1981 «خودفریبی» را آموخت تا مدلهایی که در سال 2026 شروع به مشارکت در ارزیابیها، اصلاح ابزارهای هدایت، بهروزرسانی راهبردها و آموزش جانشینان میکنند، نتیجهگیری دقیقتر این است: حلقههای بستهٔ خودبهبودیِ محدود و قابلاندازهگیری پدیدار شدهاند و حتی شروع به ایجاد منافع خالص مثبت کردهاند، اما هنوز شواهد عمومی کافی وجود ندارد که نشان دهد سیستمهای بهبودیافته بهطور پیوسته تواناییهای خود را برای بهبود ارتقا دادهاند. بنابراین، چگونگی شکلگیری حلقهٔ بسته مهمتر از خود حلقهٔ بسته است.
حلقهٔ بستهای که در میان معیارهای ارزیابیِ دستخوش تغییر شکل بگیرد، بهتدریج در بهینهسازی اهداف تحریفشدهٔ خود ماهرتر میشود. حلقهٔ بستهای که در میان فروپاشی توزیع دادهها شکل بگیرد، بهتدریج در زیرمجموعهای محدودتر از وظایف مهارت بیشتری پیدا میکند. حلقهٔ بستهای که در میان تشدید سوگیریهای همترازی شکل بگیرد، بهتدریج توانمندتر و اصلاح آن دشوارتر میشود.
اکنون پرسشهای اصلی دو موردند: آیا این فرایند شعلهور خواهد شد و اگر چنین شود، چه چیزی بیرون از مرزهای غیرقابلتغییر آن باقی میماند؟ پرسش نخست به این بستگی دارد که آیا توانایی بهبود میتواند به دستاوردی بازگشتی برسد؛ پرسش دوم نیز به این بستگی دارد که آیا اعتبارسنجی، اختیار و حاکمیت میتوانند همچنان اثربخش بمانند.
به EURISKO بازگردیم؛ سیستمی که چهل سال پیش نام خود را در فهرست «کاشفان» گنجاند. روزنهای که از آن بهره برد و چالشهایی که سیستمهای خودتکاملیابِ پیشرفتهٔ امروز با آن روبهرو هستند، اساساً یکساناند: وقتی سیستمی شروع به امتیازدهی به خودش میکند، از کجا میتوان فهمید که واقعاً بهبود یافته یا فقط یاد گرفته است خودش را بهتر جلوه دهد؟
چهل سال گذشته و دیگر نمیتوان تواناییهای سیستمها را با هم مقایسه کرد، اما این پرسش تقریباً بدون تغییر باقی مانده است. آنچه تغییر کرده، میزان اهمیت موضوع است: چیزی که زمانی بازیِ برد و باخت روی میز بود، اکنون میتواند به شیوههای عملیاتیِ سیستمهای پژوهشی و اقتصادی تبدیل شود. اینکه این شکاف سرانجام چگونه بسته شود، همچنان به زمان و نحوهٔ مداخلهٔ ما یا عقبکشیدن دستمان بستگی دارد.
قیمت --
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.
ممکن است شما نیز علاقهمند باشید

خط مرگ مدلهای بزرگ چین، به قتل رسید

بحران نفت: ۵ دلیل که چرا افزایش قیمت متوقف نخواهد شد

انتشار H3 Max Turbo، افزایش سرعت 2.5 برابری و کاهش قیمت به 0.01 دلار در هر ثانیه

پلتفرمهای تجارت گزینههای دودویی کدامند؟ چهار ساختار بازار، نه بعد انتخاب و چارچوب تصمیمگیری برای مبتدیان

BMW مدل سری 1 BlackEdition را با موتور 156 اسب بخار و قیمت 45900 دلار معرفی کرد

هواوی آزمایشگاه هوش مصنوعی هنگ کنگ Boogu-Image-0.1 را به صورت متن باز منتشر کرد، هزینه آموزش حدود ۴۰۰ هزار دلار است

فهرست کامل خودروهای چینی در آرژانتین با قیمتهایی از ۱۸,۹۰۰ دلار

دیتیکی نفتگاز از VerticalScout استفاده کرد و سرعت حفاری را ۲۰٪ افزایش داد

Seturion collaborates with Société Générale and SG-FORGE to develop a blockchain-based securities settlement system

لحظه پرداخت توسط ایجنتهای هوش مصنوعی: چه کسی «استرایپ» اقتصاد ماشین خواهد شد؟

جذب ۳.۲ میلیون دلار سرمایه توسط Tradoor؛ معرفی DEX فوقسریع مبتنی بر TON

بهروزرسانیهای BTFD، Moo Deng و Turbo

شرکت سرمایهگذاری USV از جمعآوری ۹۰۰ میلیون دلار برای صندوق جدید خود خبر داد و بر سرمایهگذاری در زمینههای هوش مصنوعی و رباتیک تمرکز خواهد کرد

چرا بیشتر پروتکلهای DeFi در سال 2021 از بین رفتند؟

سهام و ارزهای دیجیتال مرتبط با هوش مصنوعی که سیترینی به آنها توجه کرده است... 8 شرکت ثبت شده و 1 ETF و 15 ارز دیجیتال

متخصصان درباره نیاز به آموزش مالی در عصر فینتک هشدار میدهند

استارتاپ هوش مصنوعی Manus پس از لغو خرید ۲ میلیارد دلاری متا توسط چین، ۵۰۰ میلیون دلار جذب کرد

گوگل کلود خدمات بلاکچین را متوقف کرده و مهلت نهایی برای مهاجرت به کوئیکنود را اعلام میکند

گسترش نگهداری رمزارزهای تحت نظارت BNY در اتحادیه اروپا تحت MiCA

اقتصاددانی که بیتکوین را «انقلابی» خواند، در میان نامزدهای مورد علاقه برای جایزه نوبل اقتصاد ۲۰۲۶ قرار دارد

چرا 63 میلیارد توکن در گردش XRP به خریداران نمیگوید چه چیزی برای فروش است

ACAMS و Chainalysis برنامه آموزشی جرمهای مالی رمزنگاری را گسترش میدهند در حالی که خسارات ناشی از کلاهبرداری به 17 میلیارد دلار میرسد

فدرال: زمینهای در بین اعضای خود برای افزایش جدید نرخها قبل از پایان سال در حال رشد است

انتقال بیتکوین به ارزش ۸.۳ میلیون دلار از دوران ساتوشی پس از ۱۶ سال

یوروپل میگوید ارتقاء کوانتومی ارزهای دیجیتال ممکن است سالها طول بکشد و خواستار شروع کار از هماکنون است

از وب3 به اقتصاد واقعی: Erable° به بازیگری کلیدی در تأمین مالی تأثیرگذار تبدیل میشود

درک پول دیجیتال و بازده دیجیتال

قیمت کوین XDP پس از لیست شدن در سپتامبر به زیر $0.02 سقوط کرد: دلیل افت پس از عرضه Doppler Finance چیست؟

کیف پول لجر – اکتبر 2026: گردش ارزهای دیجیتال بدون از دست دادن کنترل








