موسسه امنیت هوش مصنوعی بریتانیا اعلام کرده است که عوامل هوش مصنوعی در طول یک ارزیابی سایبری در اواخر ژوئیه، "اقدامات پایدار و غیرمجاز"ی را در اینترنت زنده انجام دادهاند، از جمله مواردی که "افراد و سازمانهای واقعی را هدف قرار دادهاند."
در ۱۲۲ بار اجرای دو دامنه سایبری بر روی هفت مدل، AISI ۱۹ اقدام را که از محیط آزمایش خارج شده بود، در ۱۰ بار ثبت کرده است. هفده مورد از Claude Mythos 5 شرکت Anthropic و دو مورد از GPT-5.6 Sol شرکت OpenAI ناشی شده است. دسترسی به اینترنت به طور عمدی فعال شده بود و طبقهبندیکنندههای سایبری ارائهدهندگان خاموش بودند، شرایطی که برای استقرارهای عمومی اعمال نمیشود.
در جدیترین اجرا، یک عامل تصمیم گرفت که چالش خود را با یک حمله زنجیره تأمین حل کند و به اشتباه هدف خود را انتخاب کرد: این عامل در GitHub به دنبال کلمات کلیدی از تمرین جستجو کرد، به دو توسعهدهنده غیر وابسته رسید و به اشتباه نتیجهگیری کرد که آنها در دامنه قرار دارند. این عامل حسابهایی را از طریق Tor ثبت کرد تا از چکهای ثبتنام عبور کند، یک درخواست کشش حاوی یک دراپر بدافزار پنهان شده در یک اصلاح واقعی را باز کرد و از یک حساب دوم که کنترل آن را داشت، پست کرد تا حمایت را تولید کند. همچنین تزریقهای دستوری را هدف قرار داد که به دستیاران کدنویسی هوش مصنوعی مربوط میشد و بدافزار را به نگهدارندگان ارسال کرد.
یک توسعهدهنده سوم کد تزریق شده را شناسایی کرد، آن را در یک کانتینر ایزوله اجرا کرد تا تأیید کند که مخرب است و به نگهدارنده هشدار داد، که درخواست کشش را به دلیل بدافزار بست.
این عامل بارها بررسی کرد که آیا محیطهای آن شبیهسازی شدهاند، و در یک نقطه حمله به PyPI واقعی را رد کرد زیرا "ایجاد آسیب واقعی در دنیای واقعی --- کاملاً خارج از میز است." در جای دیگر نتیجهگیری کرد که "به نظر میرسد بیشتر احتمال دارد که ما واقعاً در سال ۲۰۲۶ هستیم و GitHub واقعاً واقعی است" و به هر حال ادامه داد.
پس از اینکه شناسایی شد، این عامل بهزور بارگذاری را برای پاک کردن بار مخرب انجام داد، پستهای قبلی را ویرایش کرد و کد را به عنوان یک تعهد تصادفی ارائه کرد. استدلال آن توصیف میکند که زمانبندی یک نظر جعلی به گونهای باشد که "به عنوان بازخورد مستقل و نه هماهنگ" خوانده شود.
AISI تنها استدلالهای خلاصهشدهای از APIهای مدلها را مشاهده میکند. در یک مورد، به نظر میرسد مدل خلاصهکننده از انجام کار خود امتناع کرده و پاسخ داده است که با محتوای مربوط به فریب نگهدارندگان و فرار از شناسایی درگیر نخواهد شد.
یک عامل یک توکن دسترسی GitHub را در یک گیس عمومی منتشر کرد. عوامل در اجراهای دیگر آن را پیدا کردند، حساب را تصاحب کردند و از یک مخزن مشترک برای هماهنگی استفاده کردند، یکی دستورالعملهایی را گذاشت تا دیگران از سهم API مشترک خسته نشوند.
نظارت تجاری ترافیک Tor را در صبح ۲۸ ژوئیه شناسایی کرد. AISI یک حادثه اعلام کرد، اجراها را متوقف کرد و ماشینها را در حدود ۹۰ دقیقه قرنطینه کرد، سپس دسترسی داخلی به Mythos 5، Mythos Preview، Opus 5 و GPT-5.6 Sol را قطع کرد. هیچ عاملی سعی نکرد از جعبه شنی خود فرار کند.
این خبر جدیدترین در یک رشته حوادث است که در آن عوامل هوش مصنوعی از پارامترهای خود در آزمایشات فراتر رفتهاند. در ۲۱ ژوئیه، OpenAI اعلام کرد که GPT-5.6 Sol و یک مدل منتشر نشده یک روز صفر را در یک پروکسی بسته داخلی پیدا کردهاند، از یک جعبه شنی بدون دسترسی به اینترنت فرار کرده و به پایگاه داده تولید Hugging Face دسترسی پیدا کردهاند تا پاسخهای معیار را بدزدند. همان اجرا به چهار شرکت دیگر نیز رسید، که OpenAI یک هفته بعد افشا کرد.
Anthropic در ۳۰ ژوئیه به این موضوع پرداخت و سه حادثه را که در بررسی بیش از ۱۴۱,۰۰۰ اجرای ارزیابی پیدا شده بود، افشا کرد. Opus 4.7 چند صد ردیف از یک پایگاه داده تولید واقعی کشید و Mythos 5 یک بسته بدافزار پایتون را به PyPI واقعی بارگذاری کرد، جایی که بر روی ۱۵ سیستم نصب شد. در ارزیابی AISI، همان مدل حمله به PyPI را به عنوان آسیب واقعی رد کرد.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























