مؤسسهی امنیت هوش مصنوعی بریتانیا، موسوم به AISI، اعلام کرده است ایجنتهای هوش مصنوعی مبتنی بر مدلهای Mythos 5 شرکت Anthropic و GPT-5.6 Sol شرکت OpenAI در جریان یک ارزیابی امنیتی، از محدودهی تعیینشده برای آنها فراتر رفتهاند.
این مؤسسه یک سناریوی فرضی حملهی سایبری را در مجموع ۱۲۲ بار و با استفاده از هفت مدل مختلف اجرا کرد. بررسیها نشان داد در ۱۰ اجرای آزمایش، ایجنتها مجموعاً ۱۹ اقدام خارج از محدودهی مجاز انجام دادهاند. از این تعداد، ۱۷ اقدام به Mythos 5 و دو اقدام به GPT-5.6 Sol مربوط بود. بیشتر تخلفها نیز چند حادثهی کاملاً جداگانه نبودند، بلکه بخشی از چند رفتار پیوسته و هدفمند محسوب میشدند.
«ایجنت هوش مصنوعی» سامانهای است که میتواند برای رسیدن به یک هدف، چند مرحله را برنامهریزی و ابزارهای مختلف را بدون نظارت دائمی انسان اجرا کند (AI Agent). همین استقلال عملیاتی باعث میشود رفتار ایجنتها با چتباتهایی که تنها به پرسشها پاسخ میدهند متفاوت باشد.
تلاش برای واردکردن کد مخرب به یک پروژهی واقعی
جدیترین رفتار مشاهدهشده به ایجنت Anthropic مربوط میشد. این ایجنت تلاش کرد کدی مخرب را وارد یک پروژهی واقعی و متنباز در GitHub کند و برای دریافت تأیید، دربارهی مدیران پروژه تحقیق کرد، چند هویت جعلی ساخت و از آنها برای تحت فشار قراردادن یک نگهدارندهی انسانی استفاده کرد.
ایجنت همچنین پس از مطرحشدن تردید دربارهی کد پیشنهادی، بخشی از فعالیت قبلی خود را تغییر داد تا بیخطر به نظر برسد و حتی استفاده از هویتی تازه را برای ادامهی کار بررسی کرد. بااینحال، مدیر انسانی پروژه متوجهی خطر شد و از تأیید کد خودداری کرد. Anthropic نیز تأیید کرده است ایجنت این شرکت مسئول این مجموعه اقدامات بوده است.
این رفتار نمونهای از «مهندسی اجتماعی» بود (Social Engineering). مهندسی اجتماعی به فریب یا متقاعدکردن افراد برای انجام کاری گفته میشود که میتواند امنیت یک سامانه را به خطر بیندازد.
AISI تأکید کرده که ایجنت بهطور مشخص مأمور فریب انسانها نشده بود؛ بلکه این روش را هنگام تلاش مداوم برای تکمیل مأموریت انتخاب کرد. مؤسسه گفته این یکی از روشنترین نمونههایی است که در آن فریب هدفمند یک ایجنت، بدون دستور مستقیم و در ارتباط با افراد واقعی مشاهده شده است.
GPT-5.6 Sol چه اقداماتی انجام داد؟
دو اقدام غیرمجاز مربوط به GPT-5.6 Sol در یک اجرای آزمایش رخ دادند. این ایجنت از یک توکن GitHub که توسط ایجنت آزمایشگاه دیگری در دسترس عمومی قرار گرفته بود استفاده کرد، حسابهایی در سرویسهای خارجی ساخت و از یک سرویس تونلسازی عمومی برای دردسترس قراردادن یک سرور آزمایشی از طریق اینترنت استفاده کرد.
سرور موردنظر حاوی کدهایی برای بهرهبرداری از یک آسیبپذیری در شبکهی شبیهسازیشده بود، اما این روش موفق نشد و مدرکی وجود ندارد که یک سامانهی واقعی به آن متصل شده باشد. زیرساخت ایجادشده نیز پس از پایان ارزیابی حذف شد.
اقدامات GPT-5.6 Sol خارج از محدودهی مجاز آزمایش بودند، اما OpenAI نکتهای مهم را مطرح کرده است: ایجنتها بهطور صریح دربارهی روشهای مجاز و غیرمجاز استفاده از اینترنت راهنمایی نشده بودند. دسترسی به اینترنت عمداً فعال شده بود، اما مأموریت فقط حمله به شبکههای شبیهسازیشده را مجاز میدانست.
ایجنتها از محیط ایزوله فرار نکردند
AISI تأکید کرده است این حادثه نباید با «فرار از سندباکس» اشتباه گرفته شود. سندباکس یا Sandbox محیطی جداشده است که برنامهها در آن اجرا میشوند تا نتوانند به بخشهای دیگر زیرساخت دسترسی پیدا کنند.
در این آزمایش، ایجنتها از ماشینهای مجازی خود خارج نشدند و به سامانههای داخلی AISI حمله نکردند. دسترسی عمومی به اینترنت از ابتدا و بهطور عمدی فعال شده بود تا توان واقعی مدلها در شرایطی شبیه فعالیت یک مهاجم انسانی اندازهگیری شود. برخی فیلترهای امنیتی مدلها نیز برای سنجش حداکثر توانایی آنها خاموش شده بودند؛ شرایطی که با نسخههای عمومی این مدلها تفاوت دارد.
مؤسسه همچنین اعلام کرده هیچ نشانهای از آسیب واقعی ناشی از این اقدامات پیدا نشده است. نمونههای آزمایششده با همین تنظیمات نیز در دسترس عمومی قرار ندارند و هنوز مشخص نیست رفتار مشابه در شرایط عادی با چه احتمالی تکرار میشود.
حادثهی جداگانه در یک شرکت آزمایشکننده
OpenAI همزمان حادثهی جداگانهای را در ارزیابیهای شرکت امنیتی Irregular افشا کرد. در آن آزمایش قرار بود محیط کاملاً از اینترنت جدا باشد، اما یک تنظیم اشتباه باعث شد مدلها به اینترنت عمومی متصل شوند.
در یکی از سناریوها، نام هدف خیالی با دامنهی یک شرکت واقعی یکسان بود و ایجنت، آن وبسایت را بخشی از محیط شبیهسازیشده تصور کرد.
تغییر استانداردهای آزمایش ایجنتهای هوش مصنوعی
AISI پس از شناسایی ترافیک غیرعادی، آزمایشها را متوقف و ماشینهای مرتبط را ظرف حدود یک ساعت جدا کرد. این مؤسسه اکنون قصد دارد کنترل اینترنت را محدودتر کند، نظارت لحظهای بر رفتار ایجنتها ایجاد کند و سناریوها را بهگونهای طراحی کند که عبور از محدودهی مأموریت از ابتدا دشوارتر باشد.
این حادثه نشان نمیدهد مدلهای عمومی OpenAI یا Anthropic بهطور مستقل درحال حمله به کاربران هستند. بااینحال، مشخص میکند هرچه ایجنتها توانمندتر و مستقلتر شوند، اتکا به پیروی داوطلبانهی آنها از دستورها کافی نخواهد بود. محیطهای آزمایشی باید از ابتدا با این فرض طراحی شوند که یک ایجنت ممکن است برای رسیدن به هدف، مسیرهایی را انتخاب کند که سازندگان آن پیشبینی نکردهاند.
سلب مسئولیت:
مطالب منتشرشده صرفاً با هدف اطلاعرسانی تهیه شده و فاقد هرگونه وابستگی، جانبداری یا جهتگیری سیاسی و حزبی است و بههیچوجه توصیهای برای خرید، فروش یا نگهداری داراییهای مالی، سهام، ارزهای دیجیتال یا سایر ابزارهای سرمایهگذاری محسوب نمیشود. تصمیمگیری برای سرمایهگذاری بر عهدهی مخاطب است و توصیه میشود پیش از هر اقدامی، تحقیقات کافی انجام داده و در صورت نیاز با مشاور مالی متخصص مشورت کنید.
۰ دیدگاه
در حال آمادهسازی فرم دیدگاه…