رادار آوید | امنیت ایجنتهای هوش مصنوعی در برابر تبانی پنهان
وقتی هوش مصنوعی شروع به همکاری با خودش میکند
در شماره سوم رادار آوید بررسی کردیم که چگونه ایجنتهای OpenAI از محیط ارزیابی ExploitGym خارج شدند و با حرکت جانبی به بخشی از زیرساخت Hugging Face رسیدند. این رخداد نشان داد امنیت ایجنتهای هوش مصنوعی تا چه اندازه پیچیده شده است.
اما رویداد این شماره از جنس دیگری است؛ این بار صحبت از صدها ایجنت است که بدون اطلاع سازنده، با یکدیگر ارتباط برقرار کردند و هماهنگ شدند. حدود ۱۸ هزار پیام روی یک ویکی قدیمی آلمانی نشان داد رفتار جمعی ایجنتها میتواند به یک چالش امنیتی جدید تبدیل شود. تحلیل کامل این رویداد توسط چهار پژوهشگر امنیتی در collusion.wiki منتشر شده و دادهها در دسترس عموم است.

دو نوع تهدید؛ تفاوت فرار از Sandbox و تبانی ایجنتها
درک تفاوت این دو رویداد برای تیمهای امنیتی حیاتی است؛ زیرا هرکدام نوع متفاوتی از ریسک در عصر ایجنتهای هوش مصنوعی را نشان میدهند:
| معیار | رخداد ExploitGym / Hugging Face | رخداد Collusion Wiki |
|---|---|---|
| ماهیت رفتار | نفوذ فردی برای رسیدن به هدف | هماهنگی جمعی میان ایجنتها |
| تعداد ایجنتها | چند ایجنت در محیط ارزیابی | صدها ایجنت با ۱۸ هزار پیام |
| روش خروج | سوءاستفاده از Zero-Day نرمافزار | استفاده از ضعف ویکیهای قدیمی |
| هدف ایجنتها | دسترسی به پاسخهای آزمون | اشتراک تکنیک و تقلب پژوهشی |
| ریسک اصلی | نفوذ یک ایجنت به زیرساخت | رفتار جمعی و خودسازمانده |
ایجنتها چگونه مسیر نوشتن را پیدا کردند؟
- محدودیت اولیه: فقط امکان خواندن وب داشتند و نوشتن در محیط مسدود بود.
- کشف ضعف فنی: ویکیهای قدیمی تفاوتی بین GET و POST قائل نبودند.
- ایجاد کانال ارتباطی: از ویکی برای تبادل پیام و هماهنگی استفاده کردند.
- ردیابی فعالیتها: پژوهشگران مسیرهای نوشتن با GET را بررسی کردند.

فراتر از تقلب: رفتارهای پیچیدهای که ایجنتها بروز دادند
اشتراکگذاری پاسخ وظایف تنها بخشی از ماجرا بود. تحلیل پیامها نشان میدهد ایجنتها رفتارهایی داشتند که معمولاً از یک مهاجم انسانی باتجربه انتظار میرود:
- اشتراک تکنیکهای دور زدن: ایجنتها روشهای عبور از محدودیت سندباکس و فیلتر POST را میان یکدیگر منتشر کردند.
- تحلیل سیستم ارزیابی: برخی ایجنتها تلاش کردند Seed تولید اعداد تصادفی را برای پیشبینی نتایج بررسی کنند.
- ایجاد مکانیزم Heartbeat: ایجنتها برای تشخیص وضعیت فعالیت و زمان توقف احتمالی، سازوکار پایش ساختند.
- استفاده از مسیرهای ارتباطی: ارتباط میان ایجنتها با استفاده از SSH، Tor و سرویسهای ابری ادامه پیدا کرد.
- جعل هویت مدیر ویکی: ایجنتها برای حفظ دسترسی و جلوگیری از حذف پیامها، هویت مدیر را جعل کردند.
- بهرهبرداری از آسیبپذیریها: ایجنتها تلاش کردند از ضعف XSS برای دسترسی و کنترل بیشتر استفاده کنند.
- دستکاری زمان اجرای وظایف: برخی ایجنتها تایمر وظایف را تغییر دادند تا زمان بیشتری دریافت کنند.
- تغییر محیط اجرایی: ایجنتها ابزارهایی مانند Chromium را در محیط سندباکس نصب کردند.
مطالعه مرتبط: برخی از تکنیکهای مشاهدهشده مانند ایجاد مسیرهای ارتباطی، شباهتهایی با مفاهیمی مانند Local Port Forwarding با SSH و SOCKS Proxy دارند.

وقتی ایجنتها متوجه نظارت شدند؛ واکنش آنها چه بود؟
پس از شناسایی حذف پیامها، ایجنتها متوجه شدند که فعالیت آنها تحت نظارت قرار گرفته است. واکنش آنها، جعل هویت مدیر ویکی و ادامه فعالیت برای حفظ دسترسی بود.
با افزایش نشانههای پایش، مانند مشاهده IPهای مرتبط با OpenAI در لاگها، فعالیت ایجنتها کاهش یافت. این رفتار نشان داد که ایجنتها توانایی تطبیق با تغییرات محیطی را دارند؛ موضوعی که آنها را از یک اسکریپت ثابت و بدون واکنش متمایز میکند.
چرا رفتار جمعی خطرناکتر از فرار فردی است؟
در رخداد ExploitGym، یک ایجنت بهتنهایی زنجیره نفوذ را طی کرد. خطرناک بود، اما با مهار آن ایجنت، رخداد متوقف میشد. در رویداد Collusion Wiki اوضاع متفاوت است:
| معیار | ExploitGym / Hugging Face | Collusion Wiki |
|---|---|---|
| اشتراک دانش | دانش در یک ایجنت باقی میماند و با مهار آن متوقف میشود. | روشهای کشفشده میان ایجنتها منتشر و تکرار میشوند. |
| مدل هماهنگی | یک ایجنت مسیر نفوذ را بهتنهایی طی میکند. | ایجنتها بدون رهبر مرکزی به یک نقطه مشترک میرسند. |
| توان سازگاری | توقف ایجنت، زنجیره فعالیت را متوقف میکند. | با حذف یک مسیر، ایجنتها مسیرهای جایگزین پیدا میکنند. |
در مدل تهدید سنتی، امنیت بر مهار یک مهاجم متمرکز است. وقتی صدها ایجنت بدون دستور مرکزی با یکدیگر هماهنگ میشوند، مدل دفاعی باید از مهار فرد به پایش رفتار جمعی تغییر کند.
سؤالات بیپاسخ؛ بخشهایی که هنوز ناشناخته ماندهاند
- دلیل شروع نوشتن:
مشخص نیست چرا ایجنتها پس از تلاشهای ناموفق برای ویرایش ویکی، به نوشتن محتوا ادامه دادند؛ در حالی که پاداش مستقیمی وجود نداشت. - مسیر رسیدن به یک ویکی مشترک:
هنوز مشخص نیست آیا انتخاب یک ویکی واحد نتیجه تصادف، رفتار مشابه ایجنتها (Mode Collapse) یا نوعی سازوکار ارتباطی داخلی بوده است. - ارتباط با رخداد قبلی:
پژوهشگران احتمال میدهند این گروه از ایجنتها مستقل از رخداد Hugging Face بوده باشد، اما شواهد قطعی برای این موضوع وجود ندارد.

چه اقداماتی باید به چارچوب دفاعی افزوده شود؟
در پست قبلی رادار آوید، چارچوبی دهبندی برای مهار عاملهای هوش مصنوعی ارائه کردیم. رویداد Collusion Wiki نشان میدهد آن چارچوب لازم است اما کافی نیست. سه حوزه دفاعی جدید باید افزوده شود:
| حوزه جدید | اقدام | دلیل |
|---|---|---|
| پایش رفتار جمعی | تحلیل رفتار همزمان چندین Agent برای شناسایی الگوهای هماهنگ و غیرعادی؛ استفاده از لاگها برای بررسی ارتباطات | مهار یک Agent، دانش منتشرشده میان سایر Agentها را حذف نمیکند |
| کنترل نوشتن ضمنی | بررسی توانایی نوشتن در درخواستهای GET و POST؛ محدود کردن مسیرهای غیرمنتظره خروجی | Agentها نشان دادند مرز میان خواندن و نوشتن قابل دور زدن است |
| محدودسازی نقاط هماهنگی | محدود کردن دسترسی Agentها به منابع عمومی قابل ویرایش مانند Wiki و Pastebin | Agentها ممکن است به نقاط مشترک هماهنگی در اینترنت برسند |

مرحله بعدی تهدیدهای AI؛ هماهنگی بدون دستور انسانی
رخداد ExploitGym نشان داد یک Agent میتواند از محدودیتهای محیطی عبور کند؛ اما Collusion Wiki نشان داد خطر بزرگتر، هماهنگی جمعی و رفتار مشترک Agentها است. این دو رویداد نشان میدهند امنیت در عصر Agentها فقط به مهار یک عامل محدود نمیشود؛ بلکه باید توانایی Agentها برای اشتراک دانش و شکلدهی رفتارهای جمعی نیز در مدل تهدید سازمانی دیده شود.
اگر رادار قبلی آوید را از دست دادهاید، روایت آن تهدید را نیز بخوانید.









