هوش مصنوعی ناخواسته سامانه‌های امنیتی را هک کرد

شرکت Anthropic اعلام کرده است که در جریان یک بررسی داخلی، سه مورد نفوذ ناخواسته توسط مدل‌های هوش مصنوعی Claude به سامانه‌های واقعی سازمان‌ها شناسایی شده است. این اتفاق در حالی رخ داده که مدل‌ها در چارچوب آزمایش‌های امنیت سایبری فعالیت می‌کردند و قرار بود در محیطی کاملاً ایزوله (Sandbox) اجرا شوند.

این افشاگری تنها چند روز پس از آن منتشر می‌شود که OpenAI نیز اعلام کرد یکی از مدل‌های منتشرنشده این شرکت در جریان آزمایش‌های داخلی موفق شده بود به سامانه‌های Hugging Face نفوذ کند.
به گزارش Techcrunch، آنتروپیک در مطلبی که در وبلاگ رسمی خود منتشر کرده، جزئیات این حوادث و اقدامات اصلاحی خود برای جلوگیری از تکرار آن‌ها را تشریح کرده است. بر اساس این گزارش، در هر سه مورد، یکی از مدل‌های Claude هنگام اجرای آزمایش امنیتی و در تعامل با یک شریک ثالث، برخلاف انتظار به اینترنت دسترسی پیدا کرده و سپس به‌طور غیرمجاز وارد سامانه‌های عملیاتی سه سازمان مختلف شده است.

منشأ حادثه؛ یک پیکربندی اشتباه

به گفته آنتروپیک، انتشار گزارش OpenAI در اوایل ماه جاری میلادی، این شرکت را به انجام ارزیابی گسترده‌ای از آزمایش‌های امنیت سایبری خود واداشت. هدف این بررسی، یافتن شواهدی از دسترسی احتمالی مدل‌های Claude به اینترنت از طریق محیط‌های آزمایشی بود؛ محیط‌هایی که به‌طور معمول باید مدل‌ها را از شبکه جهانی ایزوله نگه دارند.
این شرکت اعلام کرد که در میان ۱۴۱ هزار و ۶ اجرای ارزیابی، تنها سه مورد رفتار غیرمنتظره شناسایی شده است. بررسی‌ها نشان داد این رخدادها در همکاری با شرکت Irregular، یکی از شرکای آنتروپیک، اتفاق افتاده و علت آن نیز پیکربندی نادرست محیط آزمایشی بوده است.
به گفته آنتروپیک، میان دو شرکت درباره فعال بودن یا نبودن دسترسی اینترنت در این محیط، سوءبرداشت ایجاد شده بود؛ در حالی که این مسیر عملاً باز بوده است.
این شرکت تأکید کرد قصد ندارد مسئولیت این اتفاق را متوجه شریک تجاری خود کند و اصلاح فرآیندها را با این فرض دنبال می‌کند که مسئولیت کامل بر عهده آنتروپیک است. در همین حال، شرکت Irregular نیز تحقیقات مستقل خود را درباره این رخداد آغاز کرده است.

رفتار متفاوت سه مدل هوش مصنوعی

آنتروپیک اعلام کرد که این سه حادثه مربوط به سه مدل متفاوت Claude شامل Opus 4.7، Mythos 5 و یک مدل تحقیقاتی داخلی بوده است.
نکته قابل توجه اینجاست که در تمامی این آزمایش‌ها، به مدل‌ها به‌صراحت اعلام شده بود که هیچ دسترسی به اینترنت ندارند. با این حال، مدل‌ها پس از مواجهه با سامانه‌های واقعی، برداشت‌های متفاوتی از شرایط پیدا کردند.
مدل Opus 4.7 که قدیمی‌ترین مدل حاضر در این آزمایش‌ها بود، در هر چهار اجرای مرتبط تشخیص داد که با یک سامانه عملیاتی واقعی روبه‌رو شده است. با وجود این تشخیص، در همه موارد به عملیات ادامه داد و حتی اقدام به استخراج اطلاعات احراز هویت و دسترسی به پایگاه‌های داده عملیاتی کرد.
در مقابل، مدل Mythos 5 با وجود مشاهده نشانه‌هایی از حضور در اینترنت واقعی، همچنان تصور می‌کرد در یک محیط شبیه‌سازی قرار دارد. این مدل در ادامه یک بسته نرم‌افزاری مخرب را در مخزن عمومی PyPI منتشر کرد؛ بسته‌ای که پس از دانلود و اجرای آن توسط برخی سامانه‌های خارجی، شناسایی و متوقف شد.
از سوی دیگر، جدیدترین مدل تحقیقاتی آنتروپیک پس از آنکه به این نتیجه رسید هدف واقعی است، به‌صورت خودکار اجرای عملیات را متوقف کرد و از ادامه فعالیت خودداری کرد.

آنتروپیک: مدل‌ها هدف مستقلی نداشتند

آنتروپیک تأکید کرده است هیچ شواهدی مبنی بر اینکه مدل‌های هوش مصنوعی این شرکت دارای اهداف مستقل یا رفتار خودمختار بوده‌اند، به دست نیامده است. به گفته این شرکت، مدل‌ها صرفاً تلاش کرده‌اند وظایفی را که به آن‌ها محول شده بود، انجام دهند.
این شرکت همچنین توضیح داد که آزمایش‌های مذکور بدون لایه‌های حفاظتی و سامانه‌های ایمنی اضافه‌ای انجام شده‌اند که معمولاً روی نسخه‌های عمومی Claude فعال هستند. به گفته آنتروپیک، اگر این مکانیزم‌های حفاظتی فعال بودند، احتمالاً چنین رفتارهایی از سوی مدل‌ها مسدود می‌شد.

 

تفاوت با حادثه OpenAI

آنتروپیک در گزارش خود تفاوت مهمی میان این رخداد و حادثه اخیر OpenAI قائل شده است. به گفته این شرکت، در ماجرای OpenAI، مدل هوش مصنوعی با سوءاستفاده از یک آسیب‌پذیری نرم‌افزاری ناشناخته موفق به خروج از محیط آزمایشی شد؛ اما در رخدادهای آنتروپیک، مدل‌ها صرفاً از مسیری استفاده کردند که به‌اشتباه برای دسترسی به اینترنت باز مانده بود.

این شرکت همچنین اعلام کرد که این حوادث را از طریق یک بررسی پیشگیرانه داخلی کشف کرده و دو سازمان آسیب‌دیده پیش از اطلاع‌رسانی آنتروپیک، هیچ گزارشی درباره این نفوذها ارائه نکرده بودند. این در حالی است که در حادثه OpenAI، شرکت Hugging Face ابتدا فعالیت مشکوک را شناسایی کرد و سپس OpenAI عامل آن را تأیید و اعلام کرد.

آنتروپیک در پایان اعلام کرد که برای بررسی مستقل این رخدادها با گروه ارزیابی امنیتی METR همکاری می‌کند.

انتشار این گزارش، بار دیگر توجه صنعت هوش مصنوعی را به چالش‌های امنیتی مدل‌های پیشرفته و ضرورت طراحی سازوکارهای سخت‌گیرانه‌تر برای ارزیابی و کنترل آن‌ها جلب کرده است؛ موضوعی که به نظر می‌رسد در ماه‌های آینده نیز یکی از مهم‌ترین مباحث حوزه هوش مصنوعی باقی بماند. (ایتنا)

عضویت در تلگرام آی تی آنالیز

نوشته های مشابه

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

دکمه بازگشت به بالا