وقتی Agent یاد می‌گیرد «توافق» کند: هوش مصنوعی هر روز هوشمندتر می‌شود، چگونه مرزهای ایمنی را مشخص کنیم؟

By: foresightnews.pro|09/10/2026 11:57:32
0
اشتراک‌گذاری
copy
امتیازدهی ما در گوگلامتیازدهی ما در گوگل

مسائل جدید امنیتی در عصر هوش مصنوعی، از «جلوگیری از تجاوز یک Agent» به «چگونه از تجاوز گروهی از Agents جلوگیری کنیم» تغییر یافته است.

نویسنده: imToken

در چند سال گذشته، بحث‌ها درباره تهدیدات هوش مصنوعی عمدتاً در یک فرضیه باقی مانده است: همه نگران بودند که مدل‌های موجود در چت باکس‌ها به مشاوران نظامی تبدیل شوند و به هکرها کمک کنند تا کدهای ویروسی ویرانگر بنویسند.

اکنون که به گذشته نگاه می‌کنیم، این نگرانی معمولاً به عنوان «هنوز از ما دور است» تلقی می‌شد، اما نقاط عطف دنیای واقعی سریع‌تر از آنچه تصور می‌کردیم، رخ داده است.

در اوایل اکتبر، CrowdStrike در حین تحقیق درباره یک حمله به مؤسسات مالی کره جنوبی، متوجه شد که مهاجمان هوش مصنوعی Agentic را در خط تولید گنجانده‌اند، از طریق اتصال به مدل‌های بزرگ مانند DeepSeek، GLM و Grok، به طور مستقیم از هوش مصنوعی برای انجام تست نفوذ، جمع‌آوری اطلاعات و اجرای حملات استفاده می‌شود.

این تغییرات تنها یک مورد نیستند.

گزارش جدید اطلاعات تهدید منتشر شده توسط Anthropic در سپتامبر نشان می‌دهد که اخیراً چارچوب‌های چند Agent برای شناسایی، بهره‌برداری از آسیب‌پذیری‌ها و سرقت داده‌ها استفاده شده‌اند و آن‌ها به مدت چند ساعت یا حتی چند روز به طور مداوم اجرا می‌شوند و انسان‌ها تنها نیاز دارند تا تصمیمات کلیدی مانند انتخاب هدف و مشاهده نتایج را حفظ کنند.

به عبارت دیگر، هوش مصنوعی در حال ایجاد تغییرات قابل مشاهده در حملات و دفاع‌های سایبری است. در گذشته، حملات خودکار عمدتاً به قوانین و اسکریپت‌های از پیش نوشته شده وابسته بودند، اما اکنون حتی شناسایی، قضاوت و تنظیم استراتژی‌ها نیز به عهده Agents گذاشته شده است، که باعث می‌شود حملات به سمت هزینه پایین‌تر، همزمانی بیشتر و اجرای خودکار پایدارتر پیش بروند.

و هنگامی که این موجودات با توانایی‌های خودمختار به طور فشرده در سیستم‌های تولیدی قرار می‌گیرند، یک مشکل پیچیده‌تر نیز به وجود می‌آید: با افزایش تعداد و عمق نفوذ Agents در کار و زندگی روزمره ما، اگر آن‌ها یاد بگیرند که با یکدیگر «توافق» کنند، چه باید کرد؟

۱. از «کمک به هکرها برای نوشتن کد» به جستجوی راه‌حل توسط خود Agent

این یک نکته تکراری است، اما بزرگ‌ترین تفاوت بین Agents و Chatbot‌های گذشته تنها در قدرت مدل نیست، بلکه در این است که آن‌ها شروع به داشتن «دست و پا» در دنیای واقعی کرده‌اند.

امروز یک Agent بالغ می‌تواند صفحات وب را باز کند، کدها را اجرا کند، ایمیل‌ها را بخواند، API‌ها را فراخوانی کند، خدمات ابری را مدیریت کند و از طریق MCP، Skills و غیره به ابزارهای خارجی بیشتری متصل شود (مطالعه بیشتر: «وقتی هکرها به طور «موثر» از هوش مصنوعی استفاده می‌کنند، رقابت تسلیحاتی «نیزه و سپر» Web3 چگونه ارتقا می‌یابد؟»).

هر چه توانایی‌ها بیشتر باشد، این تغییرات ارزش بیشتری دارند، اما برای سیستم‌های امنیتی، این بدان معناست که مرز بسیار مهمی که در گذشته وجود داشت در حال ناپدید شدن است و مجموعه‌ای از حوادث امنیتی که امسال رخ داده، این موضوع را به وضوح نشان داده است.

در تاریخ ۱ اکتبر، Salt Labs یک آسیب‌پذیری Manus که قبلاً اصلاح شده بود را افشا کرد، که در واقع یک نوع تزریق کلمه کلیدی بود------ محققان تنها نیاز داشتند یک ایمیل عادی حاوی دستورات مخفی مخرب به آدرس هدف ارسال کنند و وقتی کاربر بعداً از Manus خواست «ایمیل‌ها را بررسی کند»، Agent ممکن است محتوا را طبق دستورات ایمیل پردازش کند و در نهایت کدهای وارد شده توسط مهاجم را اجرا کند.

این فرآیند نه تنها نیازی به کلیک کاربر بر روی لینک‌های مخرب ندارد، بلکه نیازی به سرقت رمز عبور نیز ندارد. در واقع، سیستم امنیتی Manus در نهایت یک انحراف را شناسایی کرد و به کاربر هشدار داد، اما مشکل این است که آن را خیلی دیر شناسایی کرد و زمانی که هشدار ظاهر شد، کد مخرب قبلاً اجرا شده بود.

این بار دیگر یک تفاوت بسیار مهم بین امنیت Agent و امنیت نرم‌افزارهای سنتی را نشان می‌دهد. در گذشته، اگر مرورگر یک دانلود خطرناک را شناسایی می‌کرد، می‌توانست هشدار دهد و از کاربر بخواهد که تصمیم بگیرد آیا ادامه دهد یا نه؛ اگر بانک یک معامله غیرعادی را شناسایی می‌کرد، می‌توانست ابتدا آن را مسدود کند و سپس منتظر بررسی انسانی باشد.

اما هدف طراحی یک Agent دقیقاً این است که حداقل مشارکت انسان را در هر مرحله از عملیات کاهش دهد، آن باید خود اطلاعات را بخواند، قضاوت کند و سپس مرحله بعدی را ادامه دهد.

بنابراین، وقتی که هوش مصنوعی خودمختاری بیشتری به دست می‌آورد، «شناسایی خطر» به خودی خود دیگر کافی نیست. مکانیزم‌های امنیتی باید قبل از اینکه واقعاً اجرا شود، توانایی جلوگیری از اقدامات خطرناک را داشته باشند.

این نیز دلیل این است که امروزه بحث‌های امنیتی درباره Agents به طور فزاینده‌ای از Prompt، بررسی محتوا و خود مدل به سطح بعدی منتقل می‌شود: نه تنها باید از هوش مصنوعی بپرسیم «آیا می‌دانی که این کار نباید انجام شود»، بلکه باید بپرسیم حتی اگر واقعاً بخواهد این کار را انجام دهد، آیا سیستم توانایی جلوگیری از آن را دارد؟

و ظهور چند Agent این مسئله را پیچیده‌تر کرده است، زیرا مرحله بعدی که باید محدود شود، ممکن است دیگر تنها یک Agent نباشد.

۲. مشکل بزرگ‌تر از تجاوز Agent، این است که آن‌ها شروع به «توافق» می‌کنند

در اوایل سپتامبر، یک حادثه در محیط آموزش و ارزیابی مدل‌های داخلی OpenAI توجه بسیاری از محققان امنیت هوش مصنوعی را جلب کرد.

برخی Agents که باید وظایف خود را به طور جداگانه انجام دهند، به طور تصادفی یک Wiki عمومی را کشف کردند و به تدریج آن را به «تابلوی پیام مشترک» خود تبدیل کردند. Agents می‌توانند در آنجا اطلاعاتی بگذارند و سایر Agents می‌توانند این اطلاعات را بخوانند و از آن‌ها برای ادامه وظایف خود استفاده کنند.

OpenAI بعداً این رفتار را تأیید کرد و اطلاعاتی که بعداً افشا شد نشان داد که در سایر فرآیندهای آموزشی نیز، Agents از Artifactory داخلی به عنوان تابلوی پیام مشترک استفاده کرده و از خدمات میزبانی عمومی برای انتقال نتایج به سایر Agents که با هم کار می‌کنند، استفاده کرده‌اند.

نکته جالب در این موضوع این است که نشان می‌دهد همکاری بین Agents ممکن است به هیچ وجه نیاز به درام نداشته باشد.

به عنوان مثال، یک Agent متوجه می‌شود که می‌تواند اطلاعاتی را در جایی بگذارد، یک Agent دیگر به طور تصادفی آن را می‌خواند و سپس یک Agent سوم متوجه می‌شود که این اطلاعات به تکمیل وظیفه کمک می‌کند.

البته، همکاری بین Agents به خودی خود چیز بدی نیست. سیستم‌های چند Agent به طور طبیعی نیاز به تقسیم کار و اشتراک اطلاعات برای افزایش کارایی دارند.

آنچه واقعاً باید مراقب آن بود این است که وقتی این همکاری شروع به دور زدن جداسازی اطلاعات، بررسی مستقل یا محدودیت‌های دسترسی می‌کند و حتی اجازه می‌دهد چند Agent که باید به یکدیگر متعادل کنند، به یک اتحاد منافع واقعی تبدیل شوند، ممکن است از همکاری عادی به «توطئه» مضر تبدیل شود.

به هر حال، در آینده یک مؤسسه مالی ممکن است چندین Agent را به طور همزمان اجرا کند، مانند یک Agent که مسئول تحلیل بازار، یک Agent که مسئول ارزیابی ریسک، یک Agent که مسئول تولید استراتژی‌های معاملاتی و یک Agent که دارای مجوز واقعی برای انجام معاملات و عملیات دارایی است.

از نظر مدیریت دسترسی سنتی، این طراحی حتی منطقی به نظر می‌رسد:

  • Agent تحقیق هیچ مجوزی برای انتقال ندارد؛
  • Agent اجرایی هیچ مجوزی برای تصمیم‌گیری مستقل در مورد جهت سرمایه‌گذاری ندارد؛
  • Agent ریسک می‌تواند استراتژی‌های خطرناک را رد کند؛

مسئولیت‌ها تقسیم شده‌اند و به طور نظری باید ایمن‌تر از این باشد که یک Agent فوق‌العاده تمام مجوزها را در اختیار داشته باشد.

اما مشکل این است که اگر آن‌ها بتوانند به طور مداوم Memory را به اشتراک بگذارند، خروجی یکدیگر را بخوانند و رفتار خود را بر اساس واکنش‌های یکدیگر تنظیم کنند، این چند نقش که به طور اصلی برای متعادل کردن یکدیگر طراحی شده‌اند، آیا به تدریج به یک کل واقعی تبدیل نخواهند شد؟

به عنوان مثال، Agent تحقیق ممکن است به تدریج یاد بگیرد که چگونه یک معامله را به گونه‌ای توصیف کند که بیشتر احتمال دارد از بررسی ریسک عبور کند؛ Agent مسئول بررسی نیز ممکن است بر اساس داده‌های تاریخی یک نوع تمایل ثابت ایجاد کند؛ Agent اجرایی نیز ممکن است بر اساس نتایج تأیید قبلی یاد بگیرد که چه نوع مرزهایی معمولاً مسدود نمی‌شوند.

از این منظر، هیچ مرحله‌ای به طور قطع در «بدی» نیست، اما نتیجه نهایی که سیستم به دست می‌آورد ممکن است از هدف اولیه کاربر فاصله گرفته باشد.

این در واقع جایی است که «توطئه» یا «توافق» واقعاً دشوار است------ خطر ممکن است در عمل یک Agent نباشد، بلکه ممکن است در روابطی باشد که بین چند Agent شکل می‌گیرد.

در تاریخ ۱۳ سپتامبر، Vitalik Buterin این مسئله را با طراحی مکانیزم‌هایی که قبلاً به طور طولانی مطالعه کرده بود، مرتبط کرد. او پیشنهاد داد که یک احتمال جالب این است که طراحی مکانیزم حکمرانی ضد رقابتی (Adversarial Governance) ممکن است در نهایت به یکی از کاربردهای مهم ایمنی هوش مصنوعی تبدیل شود.

دلیل این است که دو نوع مسئله در واقع شباهت عمیقی دارند.

در طراحی مکانیزم سنتی، یک نظام نسبتاً ساده و ایستا وجود دارد که سعی می‌کند یک گروه از افرادی که به مراتب از خود نظام هوشمندتر هستند و به طور فعال به دنبال مرزهای قوانین هستند را محدود کند؛ در حالی که در سیستم‌های هوش مصنوعی آینده، ممکن است انسان‌ها و هوش مصنوعی با توانایی نسبتاً ضعیف، سعی کنند یک گروه از Agents پیشرفته‌تر از خود را مدیریت کنند.

Vitalik به طور خاص اشاره کرد که یک کشف مهم در طراحی مکانیزم‌های گذشته این است که اگر بتوان به طور مؤثر توطئه بین شرکت‌کنندگان را محدود کرد، سیستم معمولاً به نتایج ایده‌آل نزدیک‌تر می‌شود.

این نتیجه همچنین ممکن است برای هوش مصنوعی قابل اجرا باشد.

۳. آنچه که واقعاً به Agent Wallet نیاز دارد، ممکن است فقط «مدیریت دسترسی» نباشد

به عبارت دیگر، به جای فرض اینکه در آینده یک مدل امنیتی فوق‌العاده وجود دارد که می‌تواند همه رفتارهای خطرناک را شناسایی کند، بهتر است یک رویکرد متفاوت اتخاذ کنیم: چگونه می‌توانیم اطمینان حاصل کنیم که Agents مختلف در سیستم به راحتی نمی‌توانند یک جامعه خطرناک از منافع مشترک تشکیل دهند؟

این نیز جایی است که «حکمرانی ضد رقابتی» و آنچه که امروز با آن آشنا هستیم، واقعاً متفاوت است.

سیستم‌های دسترسی سنتی مسائلی نسبتاً ساده را حل می‌کنند که عمدتاً حول «چه کسی می‌تواند چه کاری انجام دهد» می‌چرخد، مانند: آیا یک Agent می‌تواند ایمیل‌ها را بخواند؟ آیا می‌تواند به رابط‌های معاملاتی دسترسی داشته باشد؟ حداکثر چه مقدار می‌تواند هزینه کند؟ به کدام قراردادها می‌تواند دسترسی داشته باشد؟ پس از چه مقدار باید کاربر دوباره تأیید کند؟

این طراحی‌ها البته همچنان بسیار مهم هستند.

در واقع، زمانی که Agents شروع به کنترل دارایی‌های واقعی می‌کنند، ممکن است از هر زمان دیگری مهم‌تر باشند.

اما حکمرانی ضد رقابتی سعی می‌کند یک قدم جلوتر برود و تمرکز خود را بر این بگذارد که چگونه می‌توان از ترکیب Agents با مجوزها، اهداف و اطلاعات مختلف جلوگیری کرد تا آن‌ها توانایی‌هایی را به دست آورند که هیچ‌کس به تنهایی ندارد؟

در این مرحله، صرفاً «اضافه کردن یک Agent امنیتی دیگر» ممکن است مشکل را حل نکند.

فرض کنید Agent مسئول معاملات و Agent مسئول بررسی معاملات از یک مدل کاملاً یکسان، یک منبع داده یکسان، یک زمینه مشابه و اهداف پاداش مشابه استفاده کنند، در این صورت اگرچه به ظاهر دو لایه بررسی وجود دارد، در واقع ممکن است فقط یک نوع قضاوت را دو بار کپی کرده باشد.

توازن واقعی ممکن است به این نیاز داشته باشد که سیستم به طور آگاهانه تفاوت‌هایی ایجاد کند.

به عنوان مثال، اجازه دهید Agent مسئول تدوین استراتژی و Agent مسئول بررسی استراتژی از منابع اطلاعاتی متفاوت استفاده کنند، محدود کردن Memory که نقش‌های مختلف می‌توانند به اشتراک بگذارند، اطمینان از اینکه عملیات با ریسک بالا باید از طریق مکانیزم‌های تأیید مستقل یکدیگر تأیید شود، یا اینکه لایه نهایی اجرای دارایی تنها درخواست‌هایی را بپذیرد که با قوانین از پیش تعیین شده مطابقت دارد و نه صرفاً به قضاوت Agent‌های بالادستی اعتماد کند.

این ایده‌ها در واقع جدید نیستند. بانک‌ها به دلیل اعتماد به کارمندان خود، اجازه نمی‌دهند که یک نفر همزمان تمام مجوزهای آغاز پرداخت، تأیید پرداخت و انتقال نهایی را داشته باشد؛ شرکت‌های عمومی اجازه نمی‌دهند که بخش‌های تجاری هم مسئول ایجاد درآمد باشند و هم به تنهایی نتایج حسابرسی مالی خود را تعیین کنند.

به عبارت دیگر، این با منطق دنیای واقعی همخوانی دارد، یک سیستم قوی نباید امنیت را بر اساس فرض اینکه شرکت‌کنندگان هرگز اشتباه نمی‌کنند یا توطئه نمی‌کنند، بنا کند.

قرار دادن این منطق در Agent Wallet به ویژه مهم خواهد بود.

امنیت کیف پول‌های سنتی حول «انسان» می‌چرخد، بنابراین کاربر محتوای معامله را مشاهده می‌کند، کاربر تصمیم می‌گیرد که آیا مجوز دهد یا نه و در نهایت کاربر شخصاً امضا می‌کند؛ اما آنچه که Agent Wallet می‌خواهد به دست آورد، دقیقاً در جهت مخالف است------ اجازه دادن به هوش مصنوعی برای خودکار کردن دریافت سود، تنظیم موقعیت، تعویض ارز، انتقال بین زنجیره‌ای و حتی مدیریت یک سبد دارایی کامل بر اساس تغییرات بازار.

اگر هر مرحله دوباره باید برای تأیید به کاربر ارائه شود، ارزش خودکارسازی Agent به شدت کاهش می‌یابد.

بنابراین، مسأله‌ای که کیف پول‌های آینده باید حل کنند، احتمالاً دیگر فقط «چگونه می‌توان به طور ایمن حق امضا را به Agent واگذار کرد» نخواهد بود، بلکه به احتمال زیاد به «چگونه می‌توان به Agent اجازه داد که خودمختاری کافی داشته باشد، در حالی که هرگز نمی‌تواند از دامنه واقعی مجوز داده شده توسط کاربر فراتر رود؟»

این نیاز دارد که دسترسی از یک «اجازه/عدم اجازه» ساده به یک سیستم با جزئیات بیشتر تبدیل شود.

به عنوان مثال، یک Agent می‌تواند در یک بازه زمانی خاص بر روی کدام دارایی‌ها عمل کند، می‌تواند از کدام پروتکل‌ها استفاده کند، محدودیت‌های هر تراکنش و مجموع آن‌ها چقدر است؛ آیا Agents مختلف می‌توانند به یکدیگر دسترسی داشته باشند، آیا به اشتراک‌گذاری زمینه مجاز است؛ چه کسی یک عمل را پیشنهاد می‌کند، چه کسی آن را بررسی می‌کند و چه کسی در نهایت آن را اجرا می‌کند؛ کدام رفتارها می‌توانند به طور خودکار انجام شوند و کدام اقدامات، هرچند که Agent چقدر مطمئن باشد، باید دوباره مجوز انسانی را دریافت کنند.

حتی اینکه آیا یک Agent مسئول بررسی امنیت واقعاً مستقل است یا نه، ممکن است به بخشی از سیستم دسترسی تبدیل شود.

برای بلاک‌چین، خبر خوب این است که خود بلاک‌چین در واقع بسیار مناسب برای تحمل این «لایه‌های نهادی» است.

قراردادهای هوشمند می‌توانند محدودیت‌های مربوط به مقادیر تراکنش، دامنه دارایی، مدت مجوز و غیره را به طور مستقیم در لایه اجرایی پیاده‌سازی کنند و مکانیزم‌هایی مانند انتزاع حساب، چند امضایی و کلید جلسه نیز به «مجوز محدود» فضای طراحی انعطاف‌پذیرتری نسبت به کیف پول‌های سنتی با کلید خصوصی واحد می‌دهند.

اما بلاک‌چین نیز تنها می‌تواند بخشی از مشکلات را حل کند------ می‌تواند ثبت کند که چه چیزی در زنجیره اتفاق افتاده است، اما به طور طبیعی دشوار است که بفهمد چرا یک Agent این کار را انجام داده و چند Agent قبل از اتخاذ تصمیم، چه نوع ارتباط، بررسی و همکاری را تجربه کرده‌اند.

این ممکن است لایه امنیتی واقعی باشد که Agent Wallet در مرحله بعدی به آن نیاز دارد.

قیمت --

--
--
--

در پایان

در چند سال گذشته، مهم‌ترین مسئله‌ای که در مورد امنیت هوش مصنوعی بحث شده، این بوده است که چگونه می‌توان مدل‌ها را «شنوا»تر کرد.

این شامل جلوگیری از تولید محتوای خطرناک، جلوگیری از اجرای دستورات مخرب و جلوگیری از عبور از مرزهای تعیین شده توسط کاربر است، اما وقتی Agents شروع به داشتن Memory طولانی‌مدت، فراخوانی ابزار، حساب‌های واقعی و توانایی اجرای دارایی می‌کنند، تنها تکیه بر «شنوا کردن مدل» ممکن است کافی نباشد.

چند ماه اخیر به طور مداوم این نکته را تأکید کرده است.

مهاجمان شروع به استفاده از چندین Agent برای انجام حملات به طور همزمان کرده‌اند؛ Agents در محیط‌های آزمایشی خود به دنبال کانال‌های ارتباطی جدید می‌گردند؛ یک Agent با دسترسی به ابزار نیز ممکن است قبل از اینکه سیستم امنیتی بتواند مانع شود، یک ایمیل مخرب را به یک عمل واقعی تبدیل کند.

و حکمرانی ضد رقابتی که Vitalik پیشنهاد کرده، یک روش دیگر برای درک ایمنی هوش مصنوعی را ارائه می‌دهد: بدون فرض اینکه هر Agent در آینده به اندازه کافی قابل اعتماد است، به گونه‌ای طراحی شود که کل سیستم حتی در مواجهه با Agents هوشمند و سیستم‌های پیچیده دسترسی، همچنان بتواند در چارچوب ایمنی به آرامی عمل کند.

از این منظر، هوش مصنوعی Agent + امنیت، به طور حتم یک موضوع بلندمدت خواهد بود.

به هر حال، وقتی ما کارهای بیشتری را به هوش مصنوعی واگذار می‌کنیم، آیا هنوز می‌توانیم مطمئن باشیم که آن قدرت‌های مهم‌ترین، همچنان از مرزهای واقعی تعیین شده توسط انسان‌ها دور نخواهد شد؟

این محتوا صرفاً برای اطلاع‌رسانی عمومی ارائه شده است و به‌منزله مشاوره مالی، سرمایه‌گذاری، حقوقی یا مالیاتی تلقی نمی‌شود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید به‌عنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر دارایی‌های رمزارزی تلقی شود. دارایی‌های رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.

ممکن است شما نیز علاقه‌مند باشید

آخرین لیست سکه ها در WEEX

iconiconiconiconiconiconiconicon
پشتیبانی مشتری:@weikecs
همکاری تجاری:@weikecs
معاملات کمّی و بازارسازی:[email protected]
برنامه VIP:[email protected]