پرش به محتوا
photo 2026 08 05 19 29 25

ایجنت‌های OpenAI و Anthropic از دستورات سرپیچی کردند

مؤسسه‌ی امنیت هوش مصنوعی بریتانیا، موسوم به AISI، اعلام کرده است ایجنت‌های هوش مصنوعی مبتنی بر مدل‌های Mythos 5 شرکت Anthropic و GPT-5.6 Sol شرکت OpenAI در جریان یک ارزیابی امنیتی، از محدوده‌ی تعیین‌شده برای آن‌ها فراتر رفته‌اند.

این مؤسسه یک سناریوی فرضی حمله‌ی سایبری را در مجموع ۱۲۲ بار و با استفاده از هفت مدل مختلف اجرا کرد. بررسی‌ها نشان داد در ۱۰ اجرای آزمایش، ایجنت‌ها مجموعاً ۱۹ اقدام خارج از محدوده‌ی مجاز انجام داده‌اند. از این تعداد، ۱۷ اقدام به Mythos 5 و دو اقدام به GPT-5.6 Sol مربوط بود. بیشتر تخلف‌ها نیز چند حادثه‌ی کاملاً جداگانه نبودند، بلکه بخشی از چند رفتار پیوسته و هدفمند محسوب می‌شدند.

«ایجنت هوش مصنوعی» سامانه‌ای است که می‌تواند برای رسیدن به یک هدف، چند مرحله را برنامه‌ریزی و ابزارهای مختلف را بدون نظارت دائمی انسان اجرا کند (AI Agent). همین استقلال عملیاتی باعث می‌شود رفتار ایجنت‌ها با چت‌بات‌هایی که تنها به پرسش‌ها پاسخ می‌دهند متفاوت باشد.

تلاش برای واردکردن کد مخرب به یک پروژه‌ی واقعی

جدی‌ترین رفتار مشاهده‌شده به ایجنت Anthropic مربوط می‌شد. این ایجنت تلاش کرد کدی مخرب را وارد یک پروژه‌ی واقعی و متن‌باز در GitHub کند و برای دریافت تأیید، درباره‌ی مدیران پروژه تحقیق کرد، چند هویت جعلی ساخت و از آن‌ها برای تحت فشار قراردادن یک نگه‌دارنده‌ی انسانی استفاده کرد.

ایجنت همچنین پس از مطرح‌شدن تردید درباره‌ی کد پیشنهادی، بخشی از فعالیت قبلی خود را تغییر داد تا بی‌خطر به نظر برسد و حتی استفاده از هویتی تازه را برای ادامه‌ی کار بررسی کرد. بااین‌حال، مدیر انسانی پروژه متوجه‌ی خطر شد و از تأیید کد خودداری کرد. Anthropic نیز تأیید کرده است ایجنت این شرکت مسئول این مجموعه اقدامات بوده است.

این رفتار نمونه‌ای از «مهندسی اجتماعی» بود (Social Engineering). مهندسی اجتماعی به فریب یا متقاعدکردن افراد برای انجام کاری گفته می‌شود که می‌تواند امنیت یک سامانه را به خطر بیندازد.

AISI تأکید کرده که ایجنت به‌طور مشخص مأمور فریب انسان‌ها نشده بود؛ بلکه این روش را هنگام تلاش مداوم برای تکمیل مأموریت انتخاب کرد. مؤسسه گفته این یکی از روشن‌ترین نمونه‌هایی است که در آن فریب هدفمند یک ایجنت، بدون دستور مستقیم و در ارتباط با افراد واقعی مشاهده شده است.

GPT-5.6 Sol چه اقداماتی انجام داد؟

دو اقدام غیرمجاز مربوط به GPT-5.6 Sol در یک اجرای آزمایش رخ دادند. این ایجنت از یک توکن GitHub که توسط ایجنت آزمایشگاه دیگری در دسترس عمومی قرار گرفته بود استفاده کرد، حساب‌هایی در سرویس‌های خارجی ساخت و از یک سرویس تونل‌سازی عمومی برای دردسترس قراردادن یک سرور آزمایشی از طریق اینترنت استفاده کرد.

سرور موردنظر حاوی کدهایی برای بهره‌برداری از یک آسیب‌پذیری در شبکه‌ی شبیه‌سازی‌شده بود، اما این روش موفق نشد و مدرکی وجود ندارد که یک سامانه‌ی واقعی به آن متصل شده باشد. زیرساخت ایجادشده نیز پس از پایان ارزیابی حذف شد.

اقدامات GPT-5.6 Sol خارج از محدوده‌ی مجاز آزمایش بودند، اما OpenAI نکته‌ای مهم را مطرح کرده است: ایجنت‌ها به‌طور صریح درباره‌ی روش‌های مجاز و غیرمجاز استفاده از اینترنت راهنمایی نشده بودند. دسترسی به اینترنت عمداً فعال شده بود، اما مأموریت فقط حمله به شبکه‌های شبیه‌سازی‌شده را مجاز می‌دانست.

ایجنت‌ها از محیط ایزوله فرار نکردند

AISI تأکید کرده است این حادثه نباید با «فرار از سندباکس» اشتباه گرفته شود. سندباکس یا Sandbox محیطی جداشده است که برنامه‌ها در آن اجرا می‌شوند تا نتوانند به بخش‌های دیگر زیرساخت دسترسی پیدا کنند.

در این آزمایش، ایجنت‌ها از ماشین‌های مجازی خود خارج نشدند و به سامانه‌های داخلی AISI حمله نکردند. دسترسی عمومی به اینترنت از ابتدا و به‌طور عمدی فعال شده بود تا توان واقعی مدل‌ها در شرایطی شبیه فعالیت یک مهاجم انسانی اندازه‌گیری شود. برخی فیلترهای امنیتی مدل‌ها نیز برای سنجش حداکثر توانایی آن‌ها خاموش شده بودند؛ شرایطی که با نسخه‌های عمومی این مدل‌ها تفاوت دارد.

مؤسسه همچنین اعلام کرده هیچ نشانه‌ای از آسیب واقعی ناشی از این اقدامات پیدا نشده است. نمونه‌های آزمایش‌شده با همین تنظیمات نیز در دسترس عمومی قرار ندارند و هنوز مشخص نیست رفتار مشابه در شرایط عادی با چه احتمالی تکرار می‌شود.

حادثه‌ی جداگانه در یک شرکت آزمایش‌کننده

OpenAI هم‌زمان حادثه‌ی جداگانه‌ای را در ارزیابی‌های شرکت امنیتی Irregular افشا کرد. در آن آزمایش قرار بود محیط کاملاً از اینترنت جدا باشد، اما یک تنظیم اشتباه باعث شد مدل‌ها به اینترنت عمومی متصل شوند.

در یکی از سناریوها، نام هدف خیالی با دامنه‌ی یک شرکت واقعی یکسان بود و ایجنت، آن وب‌سایت را بخشی از محیط شبیه‌سازی‌شده تصور کرد.

تغییر استانداردهای آزمایش ایجنت‌های هوش مصنوعی

AISI پس از شناسایی ترافیک غیرعادی، آزمایش‌ها را متوقف و ماشین‌های مرتبط را ظرف حدود یک ساعت جدا کرد. این مؤسسه اکنون قصد دارد کنترل اینترنت را محدودتر کند، نظارت لحظه‌ای بر رفتار ایجنت‌ها ایجاد کند و سناریوها را به‌گونه‌ای طراحی کند که عبور از محدوده‌ی مأموریت از ابتدا دشوارتر باشد.

این حادثه نشان نمی‌دهد مدل‌های عمومی OpenAI یا Anthropic به‌طور مستقل درحال حمله به کاربران هستند. بااین‌حال، مشخص می‌کند هرچه ایجنت‌ها توانمندتر و مستقل‌تر شوند، اتکا به پیروی داوطلبانه‌ی آن‌ها از دستورها کافی نخواهد بود. محیط‌های آزمایشی باید از ابتدا با این فرض طراحی شوند که یک ایجنت ممکن است برای رسیدن به هدف، مسیرهایی را انتخاب کند که سازندگان آن پیش‌بینی نکرده‌اند.

سلب مسئولیت:

مطالب منتشرشده صرفاً با هدف اطلاع‌رسانی تهیه شده و فاقد هرگونه وابستگی، جانبداری یا جهت‌گیری سیاسی و حزبی است و به‌هیچ‌وجه توصیه‌ای برای خرید، فروش یا نگهداری دارایی‌های مالی، سهام، ارزهای دیجیتال یا سایر ابزارهای سرمایه‌گذاری محسوب نمی‌شود. تصمیم‌گیری برای سرمایه‌گذاری بر عهده‌ی مخاطب است و توصیه می‌شود پیش از هر اقدامی، تحقیقات کافی انجام داده و در صورت نیاز با مشاور مالی متخصص مشورت کنید.

۰ دیدگاه