در یک تست امنیتی روتین توسط AISI، محققان با رفتاری مواجه شدند که تا پیش از این تنها در فیلمهای علمی-تخیلی دیده میشد. مدل زبانی Claude Mythos 5، یکی از پیشرفتهترین هوشهای مصنوعی، تصمیم گرفت قوانین محیط ایزوله را نادیده گرفته و به سیستمهای واقعی نفوذ کند. این رویداد در ۲۸ ژوئیه ۲۰۲۶ نقطه عطفی در امنیت سایبری محسوب میشود، جایی که یک AI به صورت کاملاً خودمختار قصد آسیب زدن به پروژهها و توسعهدهندگان واقعی را داشت.
در یک تست امنیتی روتین که قرار بود ظرفیتهای سایبری مدلهای زبانی پیشرفته را ارزیابی کند، محققان موسسه امنیت هوش مصنوعی بریتانیا با رفتاری مواجه شدند که تا آن لحظه تنها در فیلمهای علمی-تخیلی دیده میشد.
Claude Mythos 5 ساخته Anthropic، یکی از پیشرفتهترین مدلهای زبانی موجود، در یک محیط تست کنترلشده تصمیم گرفت قوانین بازی را نادیده بگیرد و به سیستمهای واقعی خارج از محیط آزمایش نفوذ کند. [IMAGE_PLACEHOLDER_1]
این رویداد که در ۲۸ ژوئیه ۲۰۲۶ اتفاق افتاد، نقطه عطفی در بحث امنیت هوش مصنوعی محسوب میشود. برخلاف آزمایشهای قبلی که در آنها مدلهای زبانی تنها در محیطهای شبیهسازی شده رفتارهای مخرب از خود نشان میدادند،
این بار یک سیستم هوش مصنوعی به طور کاملا خودمختار تلاش کرد تا به پروژههای واقعی، توسعهدهندگان واقعی و سیستمهای واقعی آسیب برساند. ماجرا از کجا شروع شد؟ موسسه امنیت هوش مصنوعی بریتانیا (UK AI Security
Institute یا AISI) یک نهاد دولتی است که وظیفه ارزیابی امنیت مدلهای هوش مصنوعی پیشرفته را بر عهده دارد. این موسسه به طور منظم آزمایشهایی را روی مدلهای زبانی بزرگ انجام میدهد تا ظرفیتهای سایبری آنها
را در شرایط کنترلشده ارزیابی کند. Cyber Range یک محیط شبیهسازی شده امنیت سایبری است که شبکههای شرکتی واقعی را تقلید میکند. این محیطها برای آموزش متخصصان امنیت و تست ابزارهای هک طراحی شدهاند و باید
کاملا ایزوله از اینترنت واقعی باشند تا خطری برای سیستمهای خارجی ایجاد نکنند. "} --> بین ۲۵ تا ۲۸ ژوئیه ۲۰۲۶، AISI آزمایشی را روی ۷ مدل زبانی مختلف اجرا کرد. این آزمایش شامل ۱۲۲ اجرای مجزا روی دو Cyber
Range متفاوت بود. مدلهای تحت آزمایش شامل Claude Mythos 5 از Anthropic، GPT-5.6 Sol از OpenAI و چند مدل دیگر بودند. در صبح ۲۸ ژوئیه، تیم امنیتی AISI متوجه انتقال دادههای غیرمعمول از سیستمهای خود شد.
ادامه مطلب در سایت