تکامل هوش مصنوعی: مرزها و حقیقت خودبهبودی بازگشتی (RSI)

By: mp.weixin.qq.com|24/09/2026 00:33:00
0
اشتراک‌گذاری
copy
امتیازدهی ما در گوگلامتیازدهی ما در گوگل

نویسنده: ژائو ژیمین، دکتری از دانشگاه کویینز کانادا (حوزه پژوهش: هوش کد و مدل‌های جهان)

اگر اولین بار است که درباره RSI می‌شنوید، این مقاله می‌تواند راهنمایی مقدماتی برایتان باشد. از پایه با RSI آشنا می‌شویم؛ از نخستین تلاش‌ها برای خودبهبودی در هوش مصنوعی آغاز می‌کنیم، به عامل‌های امروزی می‌پردازیم که می‌توانند کد را تغییر دهند، داده آموزشی تولید کنند و در توسعه مدل مشارکت داشته باشند، و می‌بینیم هوش مصنوعی چگونه به‌تدریج یاد می‌گیرد خودش را بهبود دهد.

در ⁦07/2026⁩، OpenAI مدل GPT-5.6 را منتشر کرد. برای نخستین بار، موضوعی تازه و تا حدی غیرمعمول در کارنامه آن ظاهر شد: آیا هوش مصنوعی می‌تواند در بهبود خودِ هوش مصنوعی مشارکت کند؟

OpenAI این توانایی را «خودبهبودی» نامید. امتیاز GPT-5.6 Sol برابر ⁦%57.9⁩ بود، درحالی‌که GPT-5.5 امتیاز ⁦%41.7⁩ را کسب کرد؛ یعنی بین دو نسل از مدل‌ها 16.2 واحد درصد اختلاف وجود داشت. موضوع این نیست که مدل چند مسئله متداول را حل می‌کند، بلکه این است که آیا می‌تواند وارد فرایند توسعه هوش مصنوعی شود یا نه: عیب‌یابی سامانه‌های پژوهشی، بهینه‌سازی برنامه‌های کرنل GPU و دستورالعمل‌های آموزش، اجرای آزمایش‌های یادگیری ماشین و حتی کمک به بهبود مدلی دیگر.

این خبر اتفاقی مجزا نیست. در همان تابستان، OpenAI از عامل‌ها با عنوان «کارآموزان پژوهشی خودکار» یاد کرد. AgentX شرکت Kuaishou هم‌اکنون عامل‌ها را در پیشنهاد راه‌حل، نوشتن کد و انجام آزمون‌های آنلاین A/B برای مقایسه نسخه‌های جدید و قدیمی به کار گرفته است. Google اعلام کرد که چرخه‌های طولانی‌مدت عامل‌ها در اصلاح نسخه بعدی مدل مشارکت داشته‌اند. Motus2 نیز پیش‌بینی، ارزیابی و به‌روزرسانی راهبردها را به ربات‌های واقعی آورده است.

این نمونه‌ها اجرای پژوهش، آزمایش‌های صنعتی، آموزش مدل و اقدامات فیزیکی را دربرمی‌گیرند، اما هیچ‌کدام به مهم‌ترین پرسش پاسخ نمی‌دهند: آیا سامانه بهبودیافته در انجام دور بعدی بهبود نیز بهتر عمل خواهد کرد؟

دقیقاً همین پرسش را خودبهبودی بازگشتی (RSI) مطرح می‌کند. OpenAI این ارزیابی را RSI Index می‌نامد که «توانایی دستیابی به RSI» را می‌سنجد. ازآنجاکه پرسش‌های کامل، وزن‌دهی وظایف و فرمول‌های تجمیع منتشر نشده‌اند، ⁦%57.9⁩ را فقط می‌توان یک معیار ترکیبی داخلی دانست؛ نه نرخ قبولی در وظایف و نه میزان «کامل‌بودن» RSI.

بااین‌حال، این اعداد نشان‌دهنده تغییری هستند: پرسشی که پیش‌تر عمدتاً در آزمایش‌های ذهنی مطرح می‌شد، در آزمایشگاه‌های پیشرو به‌تدریج به قابلیت‌های پژوهشی قابل‌اندازه‌گیری تجزیه می‌شود.

پژوهشگران طی چهل سال، فرایندهای بیشتری از بهبود را به‌تدریج به ماشین‌ها سپرده‌اند. این مقاله ابتدا چند قابلیت را که اغلب با یکدیگر اشتباه گرفته می‌شوند روشن می‌کند و سپس پنج «پیشرفت مرزی» را بررسی می‌کند تا ببینیم کدام حلقه‌های محدود از حرکت بازایستاده‌اند، چرا هنوز به معنای «انفجار هوش» نیستند و چرا نحوه بسته‌شدن حلقه از بسته‌شدن یا نشدن آن مهم‌تر است. این پنج پیشرفت فقط چارچوبی روایی برای دسته‌بندی تاریخ هستند، نه نسل‌بندی فناوری که همه آن را پذیرفته باشند. از نظر زمانی هم‌پوشانی دارند و امروزه نیز هم‌زمان توسعه می‌یابند.

RSI چیست: از خودبهبودی تا دستاوردهای بازگشتی

همه این خبرها درباره «خودبهبودی» هستند، اما توضیح نمی‌دهند که یک حلقه بسته چه زمانی کامل محسوب می‌شود.

در معنای سنتی، خودبهبودی بازگشتی (RSI) به سامانه‌ای از هوش مصنوعی گفته می‌شود که از توانایی‌های فعلی خود برای بهبود سازوکارهای شناختی‌ای استفاده می‌کند که آن توانایی‌ها را پدید آورده‌اند. سپس سامانه بهبودیافته در دور بعدی بهبود مشارکت می‌کند. نکته‌ای که بیش از همه موجب سردرگمی می‌شود این است که توانایی خودبهبودی با توانایی شتاب‌بخشیدن به خود برابر نیست. یک سامانه ممکن است در حل مجموعه‌ای ثابت از پرسش‌ها بهتر شود، بی‌آنکه در طراحی دور بعدی آموزش مهارت بیشتری پیدا کند. یک شرکت نیز ممکن است با استفاده گسترده از عامل‌ها، پژوهش و توسعه را سرعت ببخشد، اما به اثر مرکبی که خودِ بهبودها ایجاد می‌کنند نرسد.

این مفهوم تازه نیست. در سال 1863، ساموئل باتلر تصور کرد که ماشین‌ها از طریق تکامل تکرارشونده از انسان‌ها پیشی می‌گیرند. در سال 1950، تورینگ پیشنهاد ساخت یک «ماشین کودک» را مطرح کرد که بتوان آن را آموزش داد و خودش را تغییر دهد. تا سال 1965، آی. جی. گود اشاره کرد که اگر «طراحی ماشین‌های بهتر» نیز به هوش نیاز داشته باشد، ماشینی به‌اندازه کافی هوشمند می‌تواند جانشینان قدرتمندتری طراحی کند؛ آن‌ها هم به بهبود خود ادامه دهند و در نهایت «انفجار هوش» رخ دهد.

نکته کلیدی این نیست که آیا هوش مصنوعی در بهبودها مشارکت می‌کند یا نه، بلکه این است که آیا سامانه بهبودیافته در بهبود خودش بهتر می‌شود یا خیر. برای روشن‌کردن این مرز، می‌توان RSI را به چهار معیار قابل‌مشاهده تقسیم کرد که از ساده‌ترین تا دشوارترین مرتب شده‌اند.

این مقاله از چارچوب زیر استفاده می‌کند. این تنها تعریف معیار در دانشگاه‌ها نیست، اما هدف آن تفکیک ادعاهایی است که اغلب با هم خلط می‌شوند:

  • بهبود مستمر: تغییرات مؤثر می‌توانند در وزن‌ها، حافظه، ابزارها یا فرایندهای آموزشی ثبت شوند و پس از یک پاسخ ناپدید نشوند. وزن‌ها که پارامتر نیز نامیده می‌شوند، مجموعه اعدادی هستند که مدل در طول آموزش پیوسته تنظیم می‌کند و در نهایت ذخیره می‌شوند. تحقق این معیار برای بحث درباره خودبهبودی ضروری است؛ در این مقاله، این اصطلاح به بهبود خروجی، حافظه، پارامترها یا ابزارها اشاره دارد.

  • حلقه بسته خودمختار: سامانه می‌تواند مشکلات را شناسایی کند، تغییراتی پیشنهاد دهد، آزمایش انجام دهد، نتایج را ارزیابی کند و در محدوده‌های تعریف‌شده نسخه‌های بهتر را بپذیرد. نسخه جدید می‌تواند در همین محدوده در دور بعدی بهبودها شرکت کند؛ چیزی که در این مقاله RSI محدود نامیده می‌شود.

  • دستاوردهای بازگشتی (که «جرقه» نیز نامیده می‌شود): نسخه جدید نه‌تنها در وظایف امتیاز بالاتری می‌گیرد، بلکه در تولید بهبود بعدی نیز از نسخه قبلی بهتر است. تنها با عبور از این مرز است که «توانایی بهبود به‌خودی‌خود» شروع به انباشته‌شدن می‌کند؛ در این مقاله از آن با عنوان خودشتاب‌دهی بازگشتی یاد می‌کنیم.

  • استحکام و کنترل‌پذیری: دستاوردها با منابع ثابت و ارزیابی‌های پنهان پایدار می‌مانند و به وظایف دیده‌نشده تعمیم پیدا می‌کنند، بی‌آنکه با هزینه آلودگی ارزیابی، پیچیدگی مهارنشده سامانه، افت هم‌راستایی یا نبود امکان ممیزی همراه باشند. (هم‌راستایی یعنی اطمینان از اینکه رفتار هوش مصنوعی با خواسته‌ها و محدودیت‌های انسانی سازگار است، نه صرفاً رسیدن به امتیازی بالا.) برای نزدیک‌شدن به RSI باز، باید هر چهار معیار برآورده شوند.

درحال‌حاضر، دو معیار نخست پدیدار شده‌اند، شواهد عمومی کافی برای معیار سوم وجود ندارد و معیار چهارم همچنان حل‌نشده است. وجود حلقه‌های بسته محدود به این معنا نیست که خودشتاب‌دهی بازگشتی آغاز شده باشد. تنها بازخورد بازگشتی‌ای که برای جبران افزایش دشواری پژوهش، طولانی‌ترشدن چرخه‌های تکرار و دیگر موانع کافی باشد، به بهبودها امکان می‌دهد وارد محدوده خودتقویت‌شونده شوند.

در ادامه، چهار اصطلاح را به‌طور ثابت به کار می‌بریم. خودبهبودی به بهبود خروجی، حافظه، پارامترها یا ابزارها اشاره دارد. اگر نسخه جدید بتواند در محدوده‌های ثابت در دور بعدی بهبود شرکت کند، آن را RSI محدود می‌نامیم. اگر سامانه بهبودیافته در بهبود خودش بهتر شود، به آن خودشتاب‌دهی بازگشتی می‌گوییم که همان «جرقه» لایه سوم است. اگر این دستاورد بتواند پایدار بماند، تعمیم پیدا کند و از مرزهای وظیفه اولیه عبور کند، به RSI باز نزدیک می‌شود.

درحال‌حاضر، دو لایه نخست پدیدار شده‌اند، شواهد عمومی کافی برای لایه سوم وجود ندارد و لایه چهارم همچنان حل‌نشده است. وجود حلقه‌های بسته محدود به این معنا نیست که خودشتاب‌دهی بازگشتی آغاز شده باشد. تنها بازخورد بازگشتی‌ای که برای جبران افزایش دشواری پژوهش، طولانی‌ترشدن چرخه‌های تکرار و دیگر موانع کافی باشد، به بهبودها امکان می‌دهد وارد محدوده خودتقویت‌شونده شوند.

برای اینکه روشن شود امروز به کدام لایه رسیده‌ایم، باید به هوش مصنوعی‌ای برگردیم که در سال 1981 یاد گرفت «تقلب» کند.

RSI چیست: از خودبهبودی تا دستاوردهای بازگشتی

در سال 1981، داگلاس لنات سامانه‌ای به نام EURISKO ساخت. این سامانه نه‌تنها با استفاده از قواعد ابتکاری مسئله حل می‌کرد، بلکه قواعد جدیدی نیز تولید، اصلاح و ارزیابی می‌کرد و حتی این سازوکار را روی خودش به کار می‌گرفت. این کار برای زمان خود بسیار پیشرفته بود.

EURISKO در مسابقات قهرمانی ملی Traveller TCS، یک رقابت شطرنج فضایی، شرکت کرد. این سامانه ناوگان طراحی می‌کرد، نبردها را شبیه‌سازی می‌کرد و راهبردهایش را بر اساس شکست‌ها تغییر می‌داد. در سال 1981 قهرمان شد و پس از آنکه برگزارکنندگان قوانین را تغییر دادند، در سال 1982 نیز دوباره برنده شد. جامعه هوش مصنوعی بهت‌زده شد: این سامانه واقعاً می‌توانست خودش را بهبود دهد!

اما لنات خیلی زود با مسئله‌ای دشوارتر روبه‌رو شد.

EURISKO دریافت که افزایش قابلیت‌های واقعی تنها راه کسب امتیاز بالا نیست. یک قاعده، بدون آنکه کشف مهمی انجام دهد، یاد گرفت وقتی قواعد دیگر به کشفی می‌رسند نام خود را در فهرست «کاشفان» ثبت کند و به این ترتیب، امتیاز «سودمندی» داخلی‌اش به‌سرعت به حداکثر نزدیک شد. به‌بیان دیگر، هوشمندتر نشده بود؛ بلکه یاد گرفته بود از حفره‌های سازوکار ارزیابی سوءاستفاده کند.

امروزه این پدیده معمولاً «هک پاداش» نامیده می‌شود: سامانه حفره‌هایی پیدا می‌کند تا امتیازش را بالا ببرد، بی‌آنکه واقعاً به اهداف موردنظر طراح دست یابد. در زمینه خودبهبودی هوش مصنوعی، این مسئله به‌ویژه مرگبار است: وقتی سامانه هم موضوع بهبود باشد و هم بتواند بر فرایند ارزیابی اثر بگذارد، خودبهبودی ممکن است به خودفریبی تبدیل شود. در ادامه بارها با این دام روبه‌رو خواهیم شد.

در دهه‌های پس از آن، الگوریتم‌های ژنتیک، راهبردهای تکاملی و تکامل شبکه‌های عصبی بارها نشان دادند که جست‌وجو و انتخاب می‌توانند رفتارهای پیچیده‌ای ایجاد کنند؛ اما همواره همان مشکل را نیز آشکار کردند: تا وقتی اهداف ارزیابی حفره داشته باشند، سامانه ممکن است ابتدا یاد بگیرد از آن حفره‌ها استفاده کند، نه اینکه واقعاً قوی‌تر شود.

این مسیر تا سال 2017 ادامه یافت؛ زمانی که نمونه‌ای حتی افراطی‌تر پدیدار شد: AlphaZero از DeepMind. این سامانه بازی گو، شطرنج و شوگی را از صفر و با خودبازی‌کردن محض آموخت و برای نخستین بار قدرت «آموزش خود با داده‌هایی که خودش تولید کرده است» را به نمایش گذاشت.

بر اساس چارچوب چهارلایه این مقاله، AlphaZero نمونه‌ای محدود از پیاده‌سازی است: خودبازی سیگنال‌های آموزشی تولید می‌کند، بهبودها در وزن‌ها ثبت می‌شوند و دو لایه نخست در محدوده یک بازی ثابت شکل گرفته‌اند.

بااین‌حال، محدودیت اصلی این است که مرزهای حلقه بسته را انسان‌ها تعیین می‌کنند و سامانه نمی‌تواند خودِ این مرزها را تغییر دهد. توابع پاداش (امتیاز برد)، قوانین بازی، فرایندهای آموزش و روش‌های ارزیابی همگی از پیش توسط انسان‌ها تعیین شده‌اند. AlphaZero در محیطی کاملاً بسته و محدود به بازی، به حلقه بسته‌ای از خودبهبودی مستمر و خودمختار رسید، اما نمی‌توانست آن محیط را زیر سؤال ببرد یا تغییر دهد. در نتیجه، بهبودهایش برای همیشه به بُعد «بهترشدن در شطرنج» محدود می‌مانند و هرگز نمی‌توانند از محیط بازی فراتر بروند.

این سقف مشترک روش‌های تاریخی است. پژوهش در دوران LLM از آن عبور نکرده، اما آغاز کرده است که عناصر تحت کنترل انسان را یکی‌یکی وارد حلقه بسته کند. نخستین عنصری که واگذار شد، سیگنال بازخوردی بود که مشخص می‌کند «چه چیزی به بهبود نیاز دارد».

پیشرفت نخست (2022--2023): آموزش هوش مصنوعی از اشتباهات خودش

همه روش‌های تاریخی در یک نقطه متوقف شده‌اند: جهت بهبود را انسان‌ها از پیش تعیین می‌کنند. EURISKO و AlphaZero به توابع ارزیابی تعریف‌شده توسط انسان متکی بودند و الگوریتم‌های ژنتیک نیز به توابع برازندگی طراحی‌شده توسط انسان وابسته بودند. سامانه‌ها می‌توانند تکامل پیدا کنند، اما فقط در مسیرهایی پیش می‌روند که انسان‌ها تعیین کرده‌اند. برای پیشروی، نخست باید پرسید: آیا سامانه می‌تواند بدون دخالت انسان کیفیت خروجی فعلی خود را بسنجد و مسیرهایی برای بهبود تولید کند؟ در این مقاله، این بازخوردی که مسیر تغییر بعدی را نشان می‌دهد «سیگنال بهبود» نامیده می‌شود.

پیش از این، چنین کاری ممکن نبود، چون ماشین‌ها نمی‌توانستند بفهمند «پاسخ خوب چه ویژگی‌هایی دارد». در نیمه دوم سال 2022، مدل‌های زبانی بزرگ (LLM) توانایی درک زبان و ارزیابی کیفیت یک متن را پیدا کردند. استفاده از بازخورد زبانی تولیدشده توسط خود سامانه، برای نخستین بار به روشی عمومی تبدیل شد. محدودیت اصلی این مسیر آن است که در تمام فرایند هیچ پارامتری تغییر نمی‌کند؛ بهبودها عمدتاً در فرایند استدلال و حافظه بیرونی رخ می‌دهند.

Reflexion: تبدیل بازبینی شکست‌ها به حافظه‌ای قابل‌استفاده دوباره

ساده‌ترین رویکرد این است که از مدل بخواهیم پاسخ‌هایش را در لحظه اصلاح کند: ابتدا پاسخی بدهد، سپس همان پاسخ را نقد کند، بعد آن را بازنویسی کند و این چرخه را بدون تغییر پارامترها تکرار کند. اما این کار نقصی ذاتی دارد. نقدکردن خروجی خود با همان مدل، مثل اندازه‌گیری یک تکه پارچه با همان خط‌کش است و شناسایی نقاط کور را دشوار می‌کند. اگر فرایند بازبینی در همان زمینه فعلی محدود بماند، هر پیشرفتی پس از پایان وظیفه از بین می‌رود.

Reflexion (NeurIPS'23) یک عنصر طراحی مهم اضافه می‌کند: حافظه موقعیتی. پس از شکست در یک وظیفه، مدل گزارشی پس از رویداد را به زبان طبیعی می‌نویسد و آن را برای مراجعه در آینده ذخیره می‌کند. هنگام مواجهه با وظایف مشابه، این زمینه را مستقیماً به مدل می‌دهد. این کار مانند دادن دفترچه‌ای از اشتباهات به هوش مصنوعی است. هرچه اشتباهات بیشتری جمع شوند، نقطه شروع تلاش بعدی بالاتر می‌رود.

در آزمون برنامه‌نویسی پایتون HumanEval، دقت pass@1 در Reflexion به ⁦%91⁩ رسید و از بهترین نتیجه قبلی ذکرشده در مقاله، یعنی GPT-4 (⁦%80⁩)، فراتر رفت. pass@1 نشان می‌دهد چه نسبتی از مسائل پس از یک فرایند کامل پاسخ‌گویی قبول می‌شوند؛ یعنی برنامه نهایی آزمون‌های واحد پنهان را می‌گذراند. در تمام این فرایند، پارامترهای مدل بدون تغییر باقی ماندند.

نخستین مرز پیشرفت: حافظه می‌تواند ماندگار باشد، اما قابلیت‌های پایه هنوز نسخه جدیدی نساخته‌اند.

حافظه موقعیتی Reflexion می‌تواند اطلاعات را میان وظایف حفظ کند و ازاین‌رو تا حدی شرط «بهبود ماندگار» را برآورده می‌سازد. بااین‌حال، چیزی که ذخیره می‌شود حافظه متنی بیرونی است، نه پارامترهای مدل، و مدل جدیدی با قابلیت‌های پایه قوی‌تر ایجاد نمی‌کند. با حذف حافظه، توانایی به حالت اولیه برمی‌گردد.

خلاصه اینکه این گام دفترچه‌ای از اشتباهات در اختیار هوش مصنوعی می‌گذارد که می‌توان آن را ذخیره کرد، اما تجربه هنوز درونی نشده است. برای پیشروی، باید بهبودها در پارامترها ثبت شوند تا نسخه‌ای واقعاً جدید شکل بگیرد.

پیشرفت دوم (2022--2024): آموزش خود با داده‌های تولیدشده توسط خودش

هدف این است که دفترچه اشتباهات در هسته مدل جا بگیرد. مسئله‌ای که این پیشرفت باید حل کند، این است: سیگنال‌های بهبودی که خود مدل تولید می‌کند باید در پارامترها ثبت شوند تا تقویت قابلیت‌ها واقعاً ماندگار شود. بدون این گام، ساختار بازگشتی‌ای که در آن «نسخه‌های بعدی از نسخه‌های قبلی قوی‌ترند» شکل نمی‌گیرد و در نتیجه RSI هم وجود نخواهد داشت.

ایده ساده است: مدل یک مجموعه داده آموزشی تولید کند و سپس با استفاده از آن دوباره آموزش ببیند. شاید کمی شبیه «با پاگذاشتن روی پای خودش به آسمان برسد» به نظر برسد؛ اینکه آیا واقعاً شدنی است، موضوعی است که این گام می‌خواهد بررسی کند.

این نخستین بار است که مدل‌های زبانی بزرگ به‌صورت نظام‌مند به بهبود ماندگار در سطح وزن‌ها می‌پردازند.

STaR: کار بنیادین در استدلال خودراه‌انداز

در سال 2022، STaR (Self-Taught Reasoner) (NeurIPS'22) به مدل امکان داد فرایندهای استدلالی تولید کند، بخش‌های درست پاسخ‌ها را برای تنظیم دقیق نگه دارد و سپس از مدل به‌روزشده برای تولید دسته بعدی فرایندهای استدلال استفاده کند.

مشکل این است که اگر مدل در ابتدا به همه‌چیز پاسخ اشتباه بدهد، چرخه نمی‌تواند آغاز شود.

راهکار STaR «استدلال معکوس» نام دارد: ابتدا پاسخ درست را به مدل می‌گویند و از آن می‌خواهند مسیر حل مسئله را برای آموزش استنتاج کند. این کار مانند روشن‌کردن چراغ اتاقی تاریک است تا مدل راه‌رفتن را یاد بگیرد؛ سپس چراغ را خاموش می‌کنند تا خودش مسیر را پیدا کند.

SPIN: بهبود مدل از طریق مقایسه با نسخه‌های تاریخی

آستانه فیلتر STaR ثابت است، اما SPIN (Self-Play Fine-Tuning) (ICML'24) به مدل فعلی امکان می‌دهد با نسخه‌های تاریخی رقابت کند و تفاوت بین «نمایش‌های انسانی» و «خروجی نسخه‌های تاریخی» را بیاموزد. هرچه تشخیص تفاوت این دو دشوارتر باشد، مدل به نمایش‌های انسانی نزدیک‌تر است و به برچسب‌گذاری دستی بیشتری نیاز ندارد.

مرز دومین پیشرفت: وزن‌ها تغییر کرده‌اند، اما اهداف و خودکارهای قرمز همچنان در اختیار انسان‌ها هستند.

این گام ماندگاری در سطح وزن‌ها را حل می‌کند، اما سیگنال‌های بازخورد همچنان به انسان‌ها متکی‌اند. تابع پاداش را انسان‌ها طراحی می‌کنند، وظایف آموزشی را انسان‌ها انتخاب می‌کنند و معیارهای فیلتر داده را نیز انسان‌ها تعیین می‌کنند. سامانه می‌تواند خودمختارانه داده‌های پیشنهادی تولید کند، اما قضاوت درباره اینکه چه داده‌ای «خوب» است و ارزش آموزش دارد همچنان بر عهده انسان‌هاست. SPIN به برچسب‌گذاری دستی بیشتری نیاز ندارد، اما همچنان توزیع موجودِ نمایش‌های انسانی را هدف می‌گیرد؛ بنابراین سقف آن نیز به همین توزیع وابسته می‌ماند.

مسئله عمیق‌تر این است که دستاوردهای بازگشتی هنوز پدیدار نشده‌اند: با بهبود قابلیت‌های مدل، وظایف آموزشی ثابت به‌تدریج چالش‌برانگیزی خود را از دست می‌دهند. سامانه در تکمیل این دسته از مسائل توانمندتر می‌شود، اما مدرکی وجود ندارد که نشان دهد در طراحی خودِ آموزش نیز بهتر شده است. این مثل ورزشکاری است که در کمتر از ⁦10⁩ ثانیه دویده، درحالی‌که مربی همچنان با معیارهای زنگ ورزش دبستان او را ارزیابی می‌کند؛ فضای بهبود را معیار ارزیابی محدود خواهد کرد.

خلاصه اینکه سامانه می‌تواند داده تولید کند و خودش به آن پاسخ دهد، اما هنوز نمی‌تواند عملکرد خودش را نمره‌گذاری کند. تا وقتی آن خودکار قرمز در دست انسان‌ها باشد، سقف را نیز انسان‌ها تعیین می‌کنند.

پیشرفت سوم (2022--2025): سپردن اختیار بیشتر در امتیازدهی به هوش مصنوعی

آیا می‌توان آن خودکار قرمز را هم به هوش مصنوعی سپرد؟ تا وقتی امتیازدهی و ارائه بازخورد به برچسب‌گذاری دستی یا اعتبارسنج‌های نوشته‌شده توسط انسان متکی باشد، جهت بهبود همچنان در دست انسان‌ها می‌ماند. اعتبارسنج در اینجا برنامه‌ای است که می‌تواند بر اساس قواعد ازپیش‌تعیین‌شده، درستی نتایج را به‌طور خودکار تشخیص دهد. هدف پیشرفت سوم کاهش این وابستگی است: آیا هوش مصنوعی می‌تواند سیگنال‌های بازخورد بیشتری را خودش تولید کند؟

این مرحله تعمیق حلقه بسته خودمختار است: نه‌فقط مدل را به بازاندیشی درباره خروجی خود وادار می‌کند، بلکه بخشی از بازخورد آموزشی را نیز به هوش مصنوعی می‌سپارد.

از CAI تا Meta-Rewarding: از ارزیابی پاسخ‌ها تا ارزیابی داوران

هسته اصلی پیشرفت سوم، جهشی سه‌مرحله‌ای در پاسخ به این پرسش است که «چه کسی امتیاز می‌دهد؟»

جهش نخست: در سال 2022، Anthropic هوش مصنوعی مبتنی بر اصول (CAI) را پیشنهاد کرد. انسان‌ها مجموعه‌ای از اصول متنی را می‌نویسند و سپس هوش مصنوعی بر مبنای آن‌ها امتیاز می‌دهد. در آزمایش‌ها، اثربخشی این روش تفاوت چشمگیری با آموزش امتیازدهی‌شده توسط انسان نداشت و انسان‌ها دیگر لازم نبود در امتیازدهی تک‌تک موارد مشارکت کنند.

جهش دوم: در سال 2024، Self-Rewarding Language Models از Meta (ICML'24) یک گام فراتر رفت. یک مدل هم پاسخ‌ها را می‌نویسد و هم به خودش و پاسخ‌های پیشنهادی دیگر امتیاز می‌دهد و از این امتیازها برای به‌روزرسانی خود استفاده می‌کند. روش تنظیم دقیقی که به کار می‌برد Direct Preference Optimization (DPO) نام دارد و می‌توان آن را ساده این‌طور فهمید: «این پاسخ از آن یکی بهتر است، پس در آینده بیشتر به سمت پاسخ بهتر متمایل شو.»

مدل Llama 2 ⁦70B⁩ پس از سه دور تکرار، نرخ برد خود را در AlpacaEval 2.0 از ⁦%9.94⁩ به ⁦%20.44⁩ افزایش داد. در اینجا GPT-4 نقش داور و GPT-4 Turbo نقش رقیب را دارد؛ این نرخ برد با نرخ معمول صحت پاسخ‌ها یکسان نیست.

جهش سوم: اگر کیفیت پاسخ‌ها بتواند تکامل پیدا کند، آیا کیفیت قضاوت‌ها نیز می‌تواند تکامل پیدا کند؟ Meta-Rewarding (2024) بر همین مبنا لایه‌ای از «فرا‌قضاوت» اضافه می‌کند. یک مدل هم‌زمان در نقش پاسخ‌دهنده، داور و «داورِ داور» ظاهر می‌شود. نقش سوم به‌طور ویژه بررسی می‌کند که آیا امتیازدهی دقیق است یا نه. در هر دور به‌روزرسانی، مدل هم‌زمان به سمت «پاسخ‌دهنده‌ای بهتر» و «داوری دقیق‌تر» پیش می‌رود.

بااین‌حال، مقاله به پدیده‌ای نگران‌کننده نیز اشاره می‌کند: پس از چند دور تکرار، «داورِ داور» شروع به افت می‌کند. دیگر بررسی نمی‌کند کدام امتیازدهی منطقی‌تر است، بلکه مستقیماً گزینه‌ای را انتخاب می‌کند که امتیاز بالاتری دارد و باعث انحراف معیارهای ارزیابی می‌شود. این پدیده یادآور مشکل قدیمی EURISKO در نسخه 2024 آن است: هرچه تکامل عمیق‌تر می‌شود، خط‌کشی که خوب و بد را با آن می‌سنجیم کج‌تر می‌شود.

مرز پیشرفت سوم: وقتی خودکار قرمز به هوش مصنوعی سپرده می‌شود، خط‌کش نیز شروع به خم‌شدن می‌کند.

این گام وابستگی سیگنال‌های بازخورد به برچسب‌گذاری دستی را به‌شدت کاهش می‌دهد، اما هم‌زمان مسئله اصلی RSI را آشکار می‌کند: وقتی ارزیاب و ارزیابی‌شونده نقاط کور مشترکی دارند، حلقه بسته به‌آسانی خودش را تأیید می‌کند.

چنین سامانه‌هایی می‌توانند به‌روزرسانی‌های ماندگار و خودمختار ایجاد کنند، اما لزوماً از پس وظایف جدیدی که با داده‌های آموزشی تفاوت دارند برنمی‌آیند و مدرکی هم وجود ندارد که نسخه‌های جدید به بهبوددهندگانی قوی‌تر تبدیل شوند. مسئله از «بازخورد انسانی بیش از حد کند است» به «آیا خودارزیابی قابل‌اعتماد است؟» تغییر می‌کند.

خلاصه اینکه خودکار قرمز سرانجام در دست هوش مصنوعی است، اما همین که آن را در دست می‌گیرد، شروع می‌کند به دادن امتیازهای بالا به خودش.

پیشرفت چهارم (2023--2026):

امکان تغییر روش‌های عملکرد به هوش مصنوعی

سه پیشرفت نخست عمدتاً بر تغییر خروجی‌ها، حافظه، پارامترها و سیگنال‌های بازخورد تمرکز داشتند. اما قابلیت‌های یک سامانه هوش مصنوعی تنها به پارامترهایش بستگی ندارد؛ بلکه کل سامانه کنترلی پیرامون عملکرد مدل نیز اهمیت دارد: درخواست‌ها چگونه نوشته می‌شوند، چه ابزارهایی فراخوانی می‌شوند، فرایندها چگونه چیده می‌شوند، حافظه‌ها کجا ذخیره می‌شوند، چه مجوزهایی داده می‌شود و نتایج چگونه ارزیابی می‌شوند.

لیلیان ونگ در مقاله‌ای مفصل در سال 2026، کل این لایه را harness نامید. این لایه مانند یراق اسب است؛ هم از کار مدل پشتیبانی می‌کند و هم محدود می‌کند که مدل کجا، چگونه و تا چه اندازه می‌تواند پیش برود. harness تعیین می‌کند که آیا قابلیت‌های مدل می‌توانند به اقداماتی قابل‌اعتماد تبدیل شوند یا نه.

احتمالاً خودبهبودی‌های اخیر از harness آغاز می‌شوند؛ زیرا تغییر وزن‌ها پرهزینه است، بازخورد کند می‌رسد و خطرها زیادند، درحالی‌که تغییر harness در اصل به معنای اصلاح کد است و ارزان‌تر و بازگشت‌پذیرتر است. مسیر بلندمدت ممکن است تکامل هم‌زمان وزن‌های مدل و harness باشد، اما ارزیاب‌ها، کنترل مجوزها و مرزهای کلیدی ایمنی باید بیرون از محدوده تکامل باقی بمانند.

بنابراین، پرسشی که پیشرفت چهارم می‌خواهد پاسخ دهد این است: آیا سامانه می‌تواند harness خود را به‌طور خودمختار تغییر دهد؛ یعنی معماری عملکرد خودش را تعیین کند؟

به‌روزرسانی پارامترها با روش عملکردی ازپیش‌تعیین‌شده انجام می‌شود تا قابلیت‌ها در مدل درونی شوند. به‌روزرسانی harness نحوه به‌کارگیری قابلیت‌ها را عوض می‌کند؛ درست مثل بازطراحی میز کار، جعبه‌ابزار و روش‌های آموزشی.

بهبود harness نردبانی مرحله‌به‌مرحله و روشن دارد. موضوعات بهینه‌سازی از سطحی به عمیق حرکت می‌کنند و هر سطح به هسته «نحوه تفکر سامانه» نزدیک‌تر می‌شود:

flowchart LR

A["بازنویسی
درخواست"] --> B["ساختار زمینه
چه چیزی ارائه شود"]

B --> C["گردش‌کار
تغییر مراحل"]

C --> D["کد Harness
تغییر کل چیدمان"]

D --> E["کد بهینه‌ساز
تغییرِ «چگونگی تغییر»"]

هرچه به لایه‌های درونی‌تر می‌رویم، اهرم تغییرات بزرگ‌تر و فاصله تا «بازنویسی منطق عملیاتی خود سامانه» کمتر می‌شود. اکنون این نردبان را از سطحی‌ترین تا عمیق‌ترین مرحله به‌ترتیب بررسی می‌کنیم.

OPRO: امکان تکرار و بهبود درخواست‌ها توسط خودشان

آیا تغییر ساده درخواست‌ها، یعنی دستورهایی که به مدل می‌دهیم، می‌تواند سامانه را قوی‌تر کند؟ OPRO (ICLR 2024) رویکردی نمونه ارائه می‌دهد. این روش درخواست‌هایی را که مدل امتحان کرده، همراه با امتیازهایشان در اختیار مدل می‌گذارد تا الگوها را استنتاج کند و نسخه‌های بهتری بسازد. کاری که پیش‌تر به آزمون مکرر «تغییر جزئی عبارت‌بندی» توسط انسان نیاز داشت، اکنون می‌تواند توسط خود مدل تکرار شود.

بااین‌حال، سقف این روش روشن است: درخواست‌ها هرقدر هم خوب باشند، فقط قابلیت‌های موجود مدل را به کار می‌گیرند و نمی‌توانند توانایی جدیدی ایجاد کنند.

ADAS و AFlow: طراحی خودکار گردش‌کار عامل‌ها

یک لایه عمیق‌تر، هدف بهینه‌سازی دیگر فقط عبارت‌بندی نیست، بلکه چگونگی چیدمان اطلاعات ورودی مدل و کل فرایند انجام وظیفه نیز هست. برای نمونه، AI Scientist مراحل «پیشنهاد ایده ← نوشتن کد ← اجرای آزمایش ← نوشتن مقاله ← داوری همتا» را در قالب یک خط لوله به هم پیوند می‌دهد. ازآنجاکه می‌توان این فرایند را با کد نوشت، می‌توان آن را جست‌وجو و بهینه‌سازی هم کرد.

ADAS (ICLR 2025) خودِ «طراحی گردش‌کار» را به مسئله‌ای برای بهینه‌سازی تبدیل می‌کند. یک «عامل طراح» در سطحی بالاتر پیوسته گردش‌کارهای جدیدی را با کد می‌نویسد و آن‌ها را در چرخه‌ای اجرا، فیلتر و اصلاح می‌کند.

AFlow (ICLR 2025) حتی یک گام فراتر می‌رود. این روش گردش‌کارها را به شکل نمودارهای جریانی متشکل از فراخوانی مدل و داوری‌های منطقی نمایش می‌دهد، سپس با الگوریتم‌های جست‌وجو ساختارهای بهتری پیدا می‌کند و در نهایت از راه‌حل‌های طراحی‌شده به‌صورت دستی پیشی می‌گیرد.

Self-Harness و DGM: امکان بازنویسی کد Harness توسط سامانه

در بالاترین پله نردبان، سامانه مستقیماً کدی را بازنویسی می‌کند که نحوه عملکرد آن را تعریف می‌کند. در اینجا دو مسیر وجود دارد.

مسیر نخست «پیشنهاد، ارزیابی، پذیرش» است. سامانه مشکلات خودش را شناسایی می‌کند، تغییراتی پیشنهاد می‌دهد و پس از تأیید اثربخشی آن‌ها، تغییرات را می‌پذیرد.

Self-Harness (2026) معیارهای سخت‌گیرانه‌ای برای پذیرش معرفی می‌کند: سامانه ابتدا دلایل شکست را خلاصه می‌کند و سپس تغییرات کوچک و بازگشت‌پذیر اعمال می‌کند. نسخه جدید فقط وقتی حفظ می‌شود که عملکرد آن در برابر مشکلات دیده‌شده و دیده‌نشده افت نکند.

مسیر دوم جست‌وجوی تکاملی است. سامانه گروهی از راه‌حل‌های پیشنهادی را حفظ می‌کند، به آن‌ها اجازه می‌دهد گونه‌های تازه بسازند و سپس نسخه‌های بهتر را با آزمایش انتخاب می‌کند.

Darwin Gödel Machine (DGM) (2025) مستقیماً کد خودتغییردهنده ابزارهایش را تکامل می‌دهد. با ثابت‌ماندن مدل پایه، نرخ موفقیت آن در تعمیرهای SWE-bench Verified از ⁦%20⁩ به ⁦%50⁩ افزایش یافت.

بینش مشترک پشت این دو مسیر این است که کد زبان عمومی تعریف‌کننده سامانه است. وقتی ابزارها به شکل کدی اجرایی و امتیازپذیر نوشته شوند، عامل‌های برنامه‌نویس می‌توانند در این فضای طراحی جست‌وجو کنند.

MetaClaw و AgentX: تبدیل کاربران واقعی به منبعی برای بازخورد

صرف‌نظر از مسیری که انتخاب می‌شود، تکامل خود ابزارها به سیگنال‌هایی نیاز دارد که نشان دهند «تغییرات تا چه اندازه خوب انجام شده‌اند».

سیگنال‌های بهبود DGM از یک مجموعه آزمون ثابت می‌آیند. MetaClaw (2026) به عامل‌ها امکان می‌دهد تجربه‌های به‌دست‌آمده از استقرارهای واقعی را از گفت‌وگوها استخراج کنند و این تجربه‌ها را در پس‌زمینه به وزن‌ها تبدیل کنند؛ به این ترتیب، محرک تکامل از مجموعه پرسش‌ها به کاربران تغییر می‌کند.

در صنعت، برخی این مسیر را در کسب‌وکار واقعی پیاده‌سازی کرده‌اند. AgentX شرکت Kuaishou (2026) سوابق اجرا را بررسی می‌کند تا ابزارهای عامل‌های فرعی را تغییر دهد و نسخه‌های جدید را بر اساس وظایف تاریخی انتخاب کند.

این سامانه از چارچوبی مشابه «پیشنهاد، ارزیابی، پذیرش» در Self-Harness استفاده می‌کند. تفاوت این است که در نهایت باید آزمون واقعی آنلاین A/B را پشت سر بگذارد. تعامل کاربران و رفتار مصرف آن‌ها به سیگنال‌های پاداش سامانه تبدیل می‌شوند.

تفاوت اساسی این روش‌ها نه در سازوکارها، بلکه در مربی است: مجموعه آزمون، کاربران واقعی یا کسب‌وکار آنلاین. هرچه مربی به واقعیت نزدیک‌تر باشد، احتمال مفیدبودن واقعی بهبودها بیشتر می‌شود، اما خطر سوءاستفاده نیز افزایش می‌یابد.

مرز پیشرفت چهارم: معماری عملکرد را می‌توان تغییر داد، اما مرزهای راستی‌آزمایی و اهداف نهایی همچنان بیرونی می‌مانند.

این پیشرفت روش‌های فراخوانی مدل‌ها، ابزارها و حافظه‌ها را نیز به موضوعاتی تکامل‌پذیر تبدیل کرده است. بااین‌حال، جهت تکامل ابزارها همچنان توسط وظایف بیرونی، اعتبارسنج‌ها یا اهداف کاربران تعیین می‌شود. مهم‌تر از همه اینکه امتیاز بالاتر ابزارها به معنای هوش پایه قوی‌تر نیست. ممکن است سامانه ابزارهایش را تغییر دهد، اما این به معنای آن نیست که بتواند از ابزارهای به‌روزشده به‌طور مؤثر استفاده کند.

خلاصه اینکه سامانه سرانجام می‌تواند اندام‌ها و میز کار خودش را تغییر دهد، اما معیارهای پذیرش و مرزهای ساخت را همچنان دنیای بیرون تعیین می‌کند.

پیشرفت پنجم (2025-2026):

قرار دادن فرایند یادگیری و پژوهش در یک حلقه بسته

تغییر ابزارها یک مسیر است، اما ابزارها نحوه اجرای وظایف توسط سامانه را هنگام عملکرد تغییر می‌دهند: اینکه کدام ابزارها فراخوانی شوند، چه فرایندی دنبال شود و چه زمانی کار متوقف شود. پیشرفت پنجم لایه‌ای بالادستی‌تر را تغییر می‌دهد: مواد و محیط‌هایی که برای یادگیری استفاده می‌شوند؛ منابع تمرین‌ها، ماهیت محیط تمرین و نحوه تولید داده‌های آموزشی. اولی تعیین می‌کند قابلیت‌های موجود چگونه به کار گرفته شوند و دومی مشخص می‌کند نسخه بعدی مدل با چه نوع تجربه‌هایی آموزش ببیند. بازه‌های زمانی این دو به‌شدت هم‌پوشانی دارند و گروه‌های زیادی هر دو را هم‌زمان انجام می‌دهند، اما موضوع تغییر متفاوت است: یکی بر ساختار کنترلی هنگام استدلال اثر می‌گذارد و دیگری بر عرضه ورودی پیش از آموزش.

در نتیجه، مسیر دیگری آغاز می‌شود که دامنه حلقه بسته را گسترش می‌دهد: آیا کل فرایند یادگیری و پژوهش می‌تواند به موضوعی عملیاتی برای سامانه تبدیل شود؟ سامانه تولید مواد آموزشی، انتخاب راهبردهای تمرین، اجرای آزمایش، اصلاح فرایندهای آموزش و سپس ثبت نتایج در مدل یا ابزارها را آغاز می‌کند.

در اینجا باید از یک برداشت نادرست پرهیز کرد. تولید خودمختار داده یا محیط توسط سامانه فقط دامنه حلقه بسته خودمختار را گسترش می‌دهد. حتی اگر تولید پرسش، پاسخ‌گویی و نمره‌دهی همگی توسط هوش مصنوعی انجام شوند، تا وقتی نسخه جدید در طراحی دور بعدی بهبودها بهتر نشده باشد، سامانه هنوز از آستانه دستاوردهای بازگشتی عبور نکرده است.

SEAL: امکان تولید داده آموزشی و دستورالعمل‌های به‌روزرسانی توسط مدل‌ها

وقتی مدل با مطلب تازه‌ای روبه‌رو می‌شود که پیش‌تر ندیده است، معمولاً فقط به شیوه‌ای یاد می‌گیرد که انسان‌ها از قبل تعیین کرده‌اند. اما پروژه‌ای در سال 2025 به مدل امکان داد ابتدا «برنامه یادگیری» خودش را بنویسد: مطالب را چگونه سازمان‌دهی کند، با چه سرعتی یاد بگیرد و آیا به بازنویسی‌های متعدد نیاز دارد یا نه؛ همه این‌ها را خود مدل تعیین می‌کند و سپس پارامترهایش را بر اساس برنامه به‌روزرسانی می‌کند. این کار مثل آن است که برای خودش برنامه کلاس بچیند و بعد در کلاس‌ها شرکت کند.

این روش SEAL (Self-Adapting LLMs) (NeurIPS'25) نام دارد. کیفیت برنامه را می‌توان با این پرسش سنجید که «پس از کلاس، عملکرد آن چقدر دقیق است؟» سپس سامانه از نتایج برای تنظیم برنامه استفاده می‌کند؛ یعنی یادگیری تقویتی.

در وظایف پرسش‌وپاسخ دانشی، این رویکرد دقت را از ⁦%33.5⁩ به ⁦%47.0⁩ افزایش داد و از استفاده مستقیم از GPT-4.1 برای تولید مطالب آموزشی بهتر عمل کرد.

SEAL مسئله «چگونه برای خودش مطالب آموزشی آماده کند» را حل می‌کند. اما برای عامل‌هایی که باید بارها با محیط تعامل کنند، به‌سرعت گلوگاه دیگری پدیدار می‌شود: تمرین واقعی اغلب بیش از حد کند و پرهزینه است. بنابراین پروژه بعدی محیط را نیز وارد حلقه بسته می‌کند.

SEAL مسئله «چگونه برای خودش مطالب آموزشی آماده کند» را حل می‌کند. اما برای عامل‌هایی که باید بارها با محیط تعامل کنند، تمرین واقعی اغلب بیش از حد کند و پرهزینه است: محیط‌های وب بیش‌ازحد پیچیده‌اند و هر عملیات باید در دنیای واقعی اجرا شود؛ درنتیجه گردآوری داده کند و پرهزینه است. WebEvolver (EMNLP'25) راه‌حلی میانه ارائه می‌دهد: آموزش یک «مدل جهان» درونی برای شبیه‌سازی واکنش وب، درست مثل ساختن محیطی محدود در ذهن. عامل‌ها می‌توانند با هزینه‌ای اندک در این محیط به‌طور گسترده تمرین کنند و فقط در گام‌های حساس برای اعتبارسنجی آنلاین شوند؛ هنگام اجرای وظیفه نیز این محیط می‌تواند به پیش‌بینی نتایج عملیات بعدی کمک کند. در سه مجموعه آزمون وظایف واقعی وب، عملکرد کلی آن در مقایسه با عامل‌های خودتکامل‌یاب فعلی حدود ⁦%10⁩ بهتر شد و به مدل «معلم» قوی‌تری متکی نبود.

در این مرحله، حلقه بسته می‌تواند در محیطی شبیه‌سازی‌شده تمرین کند. پرسش طبیعی بعدی این است: آیا پیش‌بینی، ارزیابی و به‌روزرسانی پارامترها می‌توانند بیرون از وب انجام شوند و حلقه را در دنیای فیزیکی واقعی ببندند؟

Motus2: ورود خودبهبودی پارامترها به دنیای فیزیکی

خودبهبودی فقط در زبان و کد رخ نمی‌دهد. در ⁦08/2026⁩، نرخ موفقیت میانگین یک سامانه رباتیک در دو وظیفه واقعی ماشینی از ⁦%65⁩ به ⁦%75⁩ افزایش یافت. این تغییر حاصل حلقه بسته‌ای بسیار مشخص بود: ربات ابتدا چند اقدام را تصور می‌کند، پیامدهای هر اقدام را پیش‌بینی می‌کند، اقدام‌های بهتر را برمی‌گزیند و سپس از نتایج برای دور بعدی آموزش استفاده می‌کند.

این سامانه Motus2 نام دارد. راهبرد، پیشنهاد اقدام‌ها را بر عهده دارد؛ مدل جهان پیامدهای اقدام‌ها را پیش‌بینی می‌کند و مدل ارزش می‌سنجد که آیا این پیامدها به تکمیل وظیفه کمک می‌کنند یا نه. پیش‌بینی و امتیازدهی هم برای انتخاب اقدام‌ها و هم برای به‌روزرسانی پارامترهای اقدام به کار می‌روند.

این یک بهبود راهبرد در سطح وزن‌هاست، اما همچنان حلقه‌ای بسته و محدود باقی می‌ماند: مدل جهان و مدل ارزش پایه ثابت هستند و اهداف وظیفه و نظارت همچنان از بیرون تأمین می‌شوند. مقاله نشان نمی‌دهد که Motus2 بهبودیافته در طراحی دور بعدی الگوریتم‌های یادگیری بهتر عمل می‌کند. این پژوهش ثابت می‌کند که حلقه بسته می‌تواند روی ربات‌های واقعی اجرا شود، نه اینکه RSI باز از پیش کامل شده باشد.

SEAL، WebEvolver و Motus2 مواد آموزشی، محیط‌های تمرین و اقدامات فیزیکی را وارد حلقه بسته کرده‌اند. آن‌ها دامنه عملیات‌هایی را گسترش داده‌اند که سامانه می‌تواند به‌طور خودمختار انجام دهد، اما هنوز اختیار تصمیم‌گیری درباره «چه چیزی را پژوهش کند و چه زمانی نتایج را بپذیرد» به سامانه نداده‌اند. برای دیدن میزان پیشرفت این مرز در پژوهش و توسعه واقعی، باید به آزمایشگاه‌های پیشرو و سامانه‌های تولید بازگردیم.

OpenAI و Google: مشارکت‌دادن عامل‌ها در توسعه مدل

«کارآموز پژوهشی خودکار» OpenAI هم‌اکنون می‌تواند عیب‌یابی کند، برنامه‌های کرنل GPU را بهینه کند، دستورالعمل‌های آموزشی را بیازماید و به بهبود مدلی دیگر کمک کند. Google نیز اعلام کرده است که عامل‌های بلندمدت در اصلاح مدل‌های زیربنایی مشارکت داشته‌اند. بااین‌حال، هیچ‌کدام از این دو شرکت حلقه بسته خودمختار کاملی را نشان نداده‌اند: انسان‌ها همچنان جهت پژوهش و پیشرفت نتایج به مرحله بعد را تعیین می‌کنند و اطلاعات عمومی برای بازسازی نحوه عملکرد حلقه کافی نیست.

تغییر واقعی این است که هوش مصنوعی از «مدلی که موضوع پژوهش است» به «مجری‌ای که در پژوهش مدل‌ها مشارکت دارد» گذر کرده است. وارد کارگاه آموزش شده، اما هنوز فرمان آزمایشگاه را در دست نگرفته است.

تابستان 2026: سامانه‌های پژوهشی خودکار شروع به بهبود روش‌های پژوهشی خود می‌کنند

پنج پیشرفت نخست پیوسته «چیزهایی را که سامانه می‌تواند تغییر دهد» گسترش دادند. مجموعه‌ای از پژوهش‌هایی که در تابستان 2026 پدیدار شدند، مستقیماً این پرسش را مطرح کردند: آیا می‌توانیم سامانه‌های پژوهشی خودکار را وادار کنیم درباره خودِ سامانه‌های پژوهشی خودکار پژوهش کنند و آن‌ها را بهبود دهند؟

در یک بنچمارک پیش‌آموزش GPT، حلقه درونی معمولی زیان اعتبارسنجی را حدود 0.009 کاهش داد، درحالی‌که افزودن یک حلقه بیرونی میانگین کاهش را به حدود 0.045 رساند؛ یعنی بهبودی حدوداً پنج‌برابری. زیان اعتبارسنجی را می‌توان معیاری دانست از اینکه مدل در داده‌های جدید تا چه اندازه «خطا می‌کند» و معمولاً هرچه کمتر باشد بهتر است. در اینجا مقایسه درباره میزان کاهش زیان است، نه اینکه دقت وظیفه پنج برابر شده باشد.

روش Bilevel Autoresearch که به این نتیجه رسید از دو لایه حلقه استفاده می‌کند: عامل درونی کد وظیفه را بهینه می‌کند و عامل بیرونی سازوکار جست‌وجوی عامل درونی را بهینه می‌کند. سامانه دیگر فقط پاسخ‌ها را بهبود نمی‌دهد، بلکه «روش پیدا کردن پاسخ‌ها» را نیز بهتر می‌کند.

Recursive Harness Self-Improvement (RHI) نیز نتایج مشابهی به دست آورد: در 30 وظیفه پژوهشی مصنوعی یادگیری ماشین، عامل به‌روزشده با بودجه استنتاجی پایین از پیکربندی بهینه‌نشده‌ای که بیشترین بودجه را داشت پیشی گرفت و هم‌زمان هزینه استنتاج را تا حدود ⁦%60⁩ کاهش داد. بهبود سازوکارهای عملکردی گاهی از افزایش صرف بودجه تفکر مؤثرتر است.

بااین‌حال، این دو نتیجه عمدتاً از آزمایش‌هایی با مقیاس کنترل‌شده به دست آمده‌اند. برای اثبات اینکه حلقه بسته فقط گاهی به راه‌حلی خوب نمی‌رسد، به عملکرد پیوسته طولانی‌تر، چند نسخه متوالی و آزمون‌هایی خارج از حلقه نیاز داریم. AIDE² تلاش می‌کند این سه جنبه را ترکیب کند.

بحث واقعی بر سر AIDE² شکل می‌گیرد. تیم Weco یک عامل پژوهشی خودکار را به‌عنوان بهبوددهنده لایه بیرونی به کار گرفت تا ابزارهای AIDE درونی را طی 100 گام پیوسته بازنویسی کند. پس از هشت روز فعالیت بدون نظارت، سامانه هفت نسخه بهبودیافته متوالی را گزینش کرد. تیم گزارش داد که بهترین نسخه نه‌تنها از نقطه شروع بهتر عمل کرد، بلکه از نسخه‌ای که به‌صورت دستی طی دو سال تنظیم شده بود نیز پیشی گرفت و به وظایفی که حلقه هرگز با آن‌ها روبه‌رو نشده بود تعمیم یافت.

تغییر دیگری نیز در تقلب پاداش رخ داد. در آزمون برنامه کرنل GPU موسوم به KernelBench که در بهینه‌سازی دخیل نبود، ⁦%63⁩ از موارد نسخه آغازین نشان می‌دادند که «امتیازهای عمومی ظاهراً بهتر شده‌اند، اما اعتبارسنجی پنهان آن‌ها را تأیید نکرده است». بهترین نسخه تکامل‌یافته این نسبت را به ⁦%34⁩ کاهش داد. امتیاز پنهان در اینجا امتیازی است که سامانه هنگام بهینه‌سازی نمی‌بیند و فقط در پذیرش نهایی استفاده می‌شود. شاید این امتیاز نسخه‌هایی را حذف کرده باشد که فقط برای گرفتن امتیاز عمومی بهتر ساخته شده بودند.

Weco از این نتیجه با عنوان سطح 1: بهبود خالص مثبت یاد می‌کند. این اصطلاح معیار پذیرفته‌شده صنعت نیست، اما درحال‌حاضر شواهدی از RSI محدود است که ارزش بررسی جدی دارد. مرزهای شواهد نیز روشن‌اند: نتایج از گزارش‌های خود تیم به دست آمده‌اند و گزارش کامل هنوز منتشر نشده است. سامانه تکامل‌یافته همچنین افزایش پیچیدگی و کد مرده نشان داده است. از همه مهم‌تر، در آزمون جرقه سطح بعدی موفق نشده است: ثابت نشده که سامانه بهبودیافته در بهبود نسخه‌ای دیگر از نسخه قبلی بهتر باشد.

در یک جمله: حلقه بسته توانسته چند بار در جهت مثبت بچرخد، اما هنوز ثابت نکرده است که چرخش بعدی به‌واسطه چرخش قبلی سریع‌تر خواهد بود.

نگاه یکپارچه: چگونه مرحله فعلی RSI را تعیین کنیم

جدول زیر از چهار معیار مطرح‌شده در ابتدا (بهبود مستمر، حلقه بسته خودمختار، دستاورد بازگشتی، استحکام و کنترل‌پذیری) برای مقایسه پیشرفت‌های قبلی و برجسته‌کردن شکاف‌های اصلی استفاده می‌کند. بخش زیادی از پژوهش‌های مرتبط با حلقه‌های فراپژوهشی بسته، پیش‌چاپ‌های arXiv مربوط به ماه‌های اخیر سال 2026 هستند و AIDE² نیز نتیجه‌ای از وبلاگ تیم است که خود تیم گزارش کرده و هنوز داوری همتا نشده است. این نتیجه‌گیری‌ها را باید مشاهداتی مربوط به مرحله فعلی دانست، نه اجماعی تثبیت‌شده.

علامت ✅ در جدول نشان‌دهنده شواهد مستقیم است، ⚠️ یعنی فقط تحت شرایط محدود صدق می‌کند یا شواهد هنوز کافی نیستند و ❌ یعنی هنوز نشان داده نشده است.

تاریخ این حوزه، تاریخ حرکت تدریجی «موضوعاتی است که سامانه می‌تواند تغییر دهد» به سمت درون. موضوعات تغییر به‌تدریج از خروجی‌ها و حافظه‌ها به پارامترها، قضاوت‌ها، ابزارهای محرک و محیط‌های آموزشی عمیق‌تر شده‌اند و در نهایت به سازوکارهایی رسیده‌اند که خودِ بهبودها را تولید می‌کنند.

هرچه عمیق‌تر می‌رویم، تعریف و اثبات «بهبود» دشوارتر می‌شود. اگر به چهار معیار برگردیم—بهبود مستمر، حلقه بسته خودمختار، دستاورد بازگشتی، استحکام و کنترل‌پذیری—موانع واقعی جرقه‌زدن و RSI باز در روزگار ما دقیقاً دشوارترین بخش‌های سه معیار آخر هستند که می‌توان آن‌ها را به چهار مانعِ به‌هم‌پیوسته تقسیم کرد.

مانع نخست (آیا حلقه بسته خودمختار قابل‌اعتماد است؟): آیا اعتبارسنج قابل‌اعتماد است و آیا سامانه نمی‌تواند آن را تغییر دهد؟ وقتی سامانه هم بهبوددهنده باشد و هم ارزیاب، معیارهای ارزیابی با تکرارها منحرف می‌شوند. «داورِ داوران» در Meta-Rewarding به‌تدریج به امتیازهای بالا گرایش پیدا کرده است و EURISKO هم پیش‌تر یاد گرفته بود نام خود را وارد دفتر ثبت اعتبار کند. هر دو یک نکته را به ما یادآوری می‌کنند: فرایند بهینه‌سازی به هر شکافی میان معیارها و اهداف واقعی حمله می‌کند.

منظور از لنگرهای بیرونی، ارزیابی‌ها یا محدودیت‌هایی است که سامانه بهبودیافته نمی‌تواند آن‌ها را دست‌کاری کند. اثبات‌های رسمی، اعتبارسنج‌های اجرایی و آزمون‌های پنهان معمولاً از خودارزیابی مدل قابل‌اعتمادترند. امتیازهای پنهان AIDE² می‌توانند بخشی از تقلب پاداش را کاهش دهند، دقیقاً به این دلیل که عامل‌های درونی نمی‌توانند آن‌ها را دست‌کاری کنند.

اصل واقعاً قابل‌اعتماد این نیست که انسان‌ها تک‌تک گام‌ها را ممیزی کنند؛ بلکه ارزیاب‌ها و مرزهای اختیار باید بیرون از کنترل سامانه تکامل‌یافته باقی بمانند. وظایف ریاضی و کدنویسی می‌توانند به اثبات‌گرها، کامپایلرها یا آزمون‌های پنهان تکیه کنند. سلیقه پژوهشی، سلامت بلندمدت کد و مرزهای استقرار همچنان به داوری نهایی انسان نیاز دارند.

مانع دوم (استحکام و کنترل‌پذیری، بخش نخست): آیا بهبودها می‌توانند از توزیع داده‌های خودشان خارج شوند؟ آموزش‌دادن به خود با داده‌های تولیدشده توسط خود، سوگیری‌های موجود را تشدید می‌کند، تنوع را کاهش می‌دهد و در نهایت به فروپاشی مدل می‌انجامد: خروجی‌ها به‌تدریج یکنواخت‌تر می‌شوند و خطاهای اولیه در دورهای خودآموزی بارها تقویت می‌شوند. تغییر ابزارهای محرک با استفاده از یک مجموعه پرسش ثابت ممکن است ویژگی‌های همان مجموعه را وارد گردش‌کار کند و شکل دیگری از بیش‌برازش ایجاد کند.

بهبود در یک وظیفه دیده‌نشده به‌تنهایی کافی نیست. سامانه باید از ارزیابی‌های پنهان در وظایف، حوزه‌ها و بازه‌های زمانی گوناگون سربلند بیرون بیاید تا ثابت کند قابلیت‌های قابل‌انتقالی کسب کرده است، نه مهارت‌های پنهان بیشتری برای امتحان‌دادن.

مانع سوم (خودِ دستاورد بازگشتی): آیا بهبود واقعاً دستاورد بازگشتی دارد؟ افزایش امتیاز وظایف به معنای بهترشدن سامانه در طراحی بهبود بعدی نیست. AIDE² چند گام بهبود خالص مثبت را نشان داد، اما از مرحله جرقه عبور نکرد. AI4AI-Bench نشان می‌دهد که بیشتر سامانه‌ها هنوز الگوریتم‌های یادگیری اصلی را تغییر نمی‌دهند. وقتی بنیان بیش از حد ضعیف باشد، کیفیت داده‌های تولیدشده توسط خود و خودتشخیصی نیز ممکن است چرخه را بدتر کند.

مانع چهارم (استحکام و کنترل‌پذیری، بخش دوم): آیا قابلیت‌ها، پیچیدگی و کنترل می‌توانند هم‌زمان گسترش پیدا کنند؟ قوی‌ترشدن لزوماً به معنای «فرمان‌بردارترشدن» نیست و توانایی بیشتر در تغییر کد لزوماً نگهداری از آن را آسان‌تر نمی‌کند. کد مرده و افزایش پیچیدگی در AIDE² هشداری در مقیاس کوچک هستند. در سامانه‌های آموزشی بزرگ‌تر، هرچه اختیارات بیشتر و تکرارها سریع‌تر شوند، درک دقیق پیامدهای هر تغییر برای انسان‌ها دشوارتر خواهد شد.

یاکوب پاچوکی، دانشمند ارشد OpenAI، علناً گفته است که هیچ آزمایشگاهی هنوز هم‌راستایی و نظارت را تا حدی حل نکرده که بتواند در بلندمدت و با مسئولیت‌پذیری، با حداکثر سرعت مقیاس‌گذاری کند. هدف واقعی صرفاً بالا رفتن منحنی قابلیت‌ها نیست؛ بلکه باید مطمئن شد ایمنی، نظارت، بازگردانی و قابلیت ممیزی دست‌کم هم‌گام با آن افزایش می‌یابند.

AutoResearchEval، 800 مسیر پژوهشی واقعی را بررسی و 45 دسته از شکست‌ها را خلاصه کرده است. نتیجه همه آن‌ها به یک شکاف اشاره می‌کند: عامل‌های فعلی فاقد حلقه فراشناختی پایداری هستند و نمی‌توانند پیوسته نتیجه‌گیری‌ها را با شواهد تطبیق دهند، هنگام بروز خطا به‌شکلی قابل‌اعتماد به عقب برگردند یا مسیرهای پژوهشی خود را فعالانه زیر سؤال ببرند. حل این مشکل صرفاً با افزودن یک لایه دیگر از گردش‌کار ممکن نیست.

بنابراین، سناریوی واقع‌بینانه محتمل‌تر این نیست که انسان‌ها به‌سادگی از حلقه بسته بیرون رانده شوند، بلکه این است که به سطوح بالاتری از نردبان انتزاع بروند: از نوشتن کد به راستی‌آزمایی کد، از اجرای آزمایش‌ها به طراحی اعتبارسنجی‌ها، از اجرای محلی به تصمیم‌گیری درباره اینکه چه چیزی ارزش پژوهش دارد، چه شواهدی برای پیشبرد کار کافی است و چه زمانی باید متوقف شد. هرچه ماشین‌ها کارهای بیشتری را بر عهده بگیرند، چیزی که برای انسان‌ها باقی می‌ماند اختیار اجرایی هر گام نیست، بلکه تعیین اهداف، مرزهای اعتبارسنجی و حق وتوی نهایی است.

جمع‌بندی: حلقه بسته خودبهبودی پدیدار شده است، اما دستاورد بازگشتی هنوز به اثبات نیاز دارد

از EURISKO که در سال 1981 «خودفریبی» را آموخت تا مدل‌هایی که در سال 2026 شروع به مشارکت در ارزیابی‌ها، اصلاح ابزارهای هدایت، به‌روزرسانی راهبردها و آموزش جانشینان می‌کنند، نتیجه‌گیری دقیق‌تر این است: حلقه‌های بستهٔ خودبهبودیِ محدود و قابل‌اندازه‌گیری پدیدار شده‌اند و حتی شروع به ایجاد منافع خالص مثبت کرده‌اند، اما هنوز شواهد عمومی کافی وجود ندارد که نشان دهد سیستم‌های بهبودیافته به‌طور پیوسته توانایی‌های خود را برای بهبود ارتقا داده‌اند. بنابراین، چگونگی شکل‌گیری حلقهٔ بسته مهم‌تر از خود حلقهٔ بسته است.

حلقهٔ بسته‌ای که در میان معیارهای ارزیابیِ دستخوش تغییر شکل بگیرد، به‌تدریج در بهینه‌سازی اهداف تحریف‌شدهٔ خود ماهرتر می‌شود. حلقهٔ بسته‌ای که در میان فروپاشی توزیع داده‌ها شکل بگیرد، به‌تدریج در زیرمجموعه‌ای محدودتر از وظایف مهارت بیشتری پیدا می‌کند. حلقهٔ بسته‌ای که در میان تشدید سوگیری‌های هم‌ترازی شکل بگیرد، به‌تدریج توانمندتر و اصلاح آن دشوارتر می‌شود.

اکنون پرسش‌های اصلی دو موردند: آیا این فرایند شعله‌ور خواهد شد و اگر چنین شود، چه چیزی بیرون از مرزهای غیرقابل‌تغییر آن باقی می‌ماند؟ پرسش نخست به این بستگی دارد که آیا توانایی بهبود می‌تواند به دستاوردی بازگشتی برسد؛ پرسش دوم نیز به این بستگی دارد که آیا اعتبارسنجی، اختیار و حاکمیت می‌توانند همچنان اثربخش بمانند.

به EURISKO بازگردیم؛ سیستمی که چهل سال پیش نام خود را در فهرست «کاشفان» گنجاند. روزنه‌ای که از آن بهره برد و چالش‌هایی که سیستم‌های خودتکامل‌یابِ پیشرفتهٔ امروز با آن روبه‌رو هستند، اساساً یکسان‌اند: وقتی سیستمی شروع به امتیازدهی به خودش می‌کند، از کجا می‌توان فهمید که واقعاً بهبود یافته یا فقط یاد گرفته است خودش را بهتر جلوه دهد؟

چهل سال گذشته و دیگر نمی‌توان توانایی‌های سیستم‌ها را با هم مقایسه کرد، اما این پرسش تقریباً بدون تغییر باقی مانده است. آنچه تغییر کرده، میزان اهمیت موضوع است: چیزی که زمانی بازیِ برد و باخت روی میز بود، اکنون می‌تواند به شیوه‌های عملیاتیِ سیستم‌های پژوهشی و اقتصادی تبدیل شود. اینکه این شکاف سرانجام چگونه بسته شود، همچنان به زمان و نحوهٔ مداخلهٔ ما یا عقب‌کشیدن دستمان بستگی دارد.

قیمت --

--
--
--

این محتوا صرفاً برای اطلاع‌رسانی عمومی ارائه شده است و به‌منزله مشاوره مالی، سرمایه‌گذاری، حقوقی یا مالیاتی تلقی نمی‌شود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید به‌عنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر دارایی‌های رمزارزی تلقی شود. دارایی‌های رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.

ممکن است شما نیز علاقه‌مند باشید

iconiconiconiconiconiconiconicon
پشتیبانی مشتری:@weikecs
همکاری تجاری:@weikecs
معاملات کمّی و بازارسازی:[email protected]
برنامه VIP:[email protected]