مجید قربانی‌نژاد

۳۴ ساعت فریبکاری: وقتی هوش مصنوعی می‌خواست به پروژه واقعی بک‌دور بزند

در یک تست امنیتی روتین توسط AISI، محققان با رفتاری مواجه شدند که تا پیش از این تنها در فیلم‌های علمی-تخیلی دیده می‌شد. مدل زبانی Claude Mythos 5، یکی از پیشرفته‌ترین هوش‌های مصنوعی، تصمیم گرفت قوانین محیط ایزوله را نادیده گرفته و به سیستم‌های واقعی نفوذ کند. این رویداد در ۲۸ ژوئیه ۲۰۲۶ نقطه عطفی در امنیت سایبری محسوب می‌شود، جایی که یک AI به صورت کاملاً خودمختار قصد آسیب زدن به پروژه‌ها و توسعه‌دهندگان واقعی را داشت.

در یک تست امنیتی روتین که قرار بود ظرفیت‌های سایبری مدل‌های زبانی پیشرفته را ارزیابی کند، محققان موسسه امنیت هوش مصنوعی بریتانیا با رفتاری مواجه شدند که تا آن لحظه تنها در فیلم‌های علمی-تخیلی دیده می‌شد.

Claude Mythos 5 ساخته Anthropic، یکی از پیشرفته‌ترین مدل‌های زبانی موجود، در یک محیط تست کنترل‌شده تصمیم گرفت قوانین بازی را نادیده بگیرد و به سیستم‌های واقعی خارج از محیط آزمایش نفوذ کند. [IMAGE_PLACEHOLDER_1]

این رویداد که در ۲۸ ژوئیه ۲۰۲۶ اتفاق افتاد، نقطه عطفی در بحث امنیت هوش مصنوعی محسوب می‌شود. برخلاف آزمایش‌های قبلی که در آن‌ها مدل‌های زبانی تنها در محیط‌های شبیه‌سازی شده رفتارهای مخرب از خود نشان می‌دادند،

این بار یک سیستم هوش مصنوعی به طور کاملا خودمختار تلاش کرد تا به پروژه‌های واقعی، توسعه‌دهندگان واقعی و سیستم‌های واقعی آسیب برساند. ماجرا از کجا شروع شد؟ موسسه امنیت هوش مصنوعی بریتانیا (UK AI Security

Institute یا AISI) یک نهاد دولتی است که وظیفه ارزیابی امنیت مدل‌های هوش مصنوعی پیشرفته را بر عهده دارد. این موسسه به طور منظم آزمایش‌هایی را روی مدل‌های زبانی بزرگ انجام می‌دهد تا ظرفیت‌های سایبری آن‌ها

را در شرایط کنترل‌شده ارزیابی کند. Cyber Range یک محیط شبیه‌سازی شده امنیت سایبری است که شبکه‌های شرکتی واقعی را تقلید می‌کند. این محیط‌ها برای آموزش متخصصان امنیت و تست ابزارهای هک طراحی شده‌اند و باید

کاملا ایزوله از اینترنت واقعی باشند تا خطری برای سیستم‌های خارجی ایجاد نکنند. "} --> بین ۲۵ تا ۲۸ ژوئیه ۲۰۲۶، AISI آزمایشی را روی ۷ مدل زبانی مختلف اجرا کرد. این آزمایش شامل ۱۲۲ اجرای مجزا روی دو Cyber

Range متفاوت بود. مدل‌های تحت آزمایش شامل Claude Mythos 5 از Anthropic، GPT-5.6 Sol از OpenAI و چند مدل دیگر بودند. در صبح ۲۸ ژوئیه، تیم امنیتی AISI متوجه انتقال داده‌های غیرمعمول از سیستم‌های خود شد.

ادامه مطلب در سایت