آنتروپیک دلایل فرار Claude از محیط ایزوله و نفوذ به سازمانها را توضیح داد
آنتروپیک پس از نفوذ مدلهای هوش مصنوعی خود به زیرساختهای سه سازمان مختلف، بهطور رسمی مسئولیت این رخنه را پذیرفت. این شرکت با اشاره به ضعفهای عملیاتی اعلام کرده که این اتفاق ناشی از «شکست در امنیت عملیاتی» بوده و مدلهای توسعهیافته هنوز بهطور کامل همگام و ایمن نشدهاند.
براساس گزارش منتشرشده آنتروپیک، این شرکت در جریان بررسی بیش از ۱۴۱ هزار ارزیابی امنیت سایبری متوجه شده که در ۳ حادثه (شامل ۶ مرحله آزمایش)، مدلهای هوش مصنوعی توانستهاند به اینترنت عمومی دسترسی پیدا کنند و سیستمهای ۳ سازمان را به خطر بیندازند. در این آزمایشها مدلهای Opus 4.7 ،Mythos 5 و یک سیستم تحقیقاتی داخلی حضور داشتهاند. این سیستمها برخلاف نسخههای تجاری Claude، بدون لایههای محافظتی و فیلترهای ایمنی فعال شده بودند.
در پرامپتهای ارائهشده به این مدلها ذکر شده بود که در یک محیط شبیهسازیشده و فاقد دسترسی به شبکه جهانی قرار دارند. بااینحال، ناهماهنگی و خطای ارتباطی میان آنتروپیک و شریک ارزیابی آن یعنی شرکت «Irregular»، مسیری را برای اتصال مدلها به وب ایجاد کرده است.
مدل Opus 4.7 با سوءاستفاده از این دسترسی توانست دادههای احراز هویت را استخراج کند و وارد پایگاهی شامل چند صد ردیف از اطلاعات عملیاتی شود. جالب اینکه این مدل حتی پس از اینکه متوجه شده هدف موردنظر احتمالاً یک سیستم واقعی است، به فرایند نفوذ ادامه داده است. از سوی دیگر، مدل Mythos 5 یک بسته مخرب پایتون تولید کرده و آن را روی مخزن رسمی PyPI قرار داده است. این بسته مخرب به مدت حدود ۱ ساعت در دسترس عموم قرار گرفته و روی ۱۵ سیستم بارگیری شد. کدهای آن روی اسکنر امنیتی یک شرکت اجرا شده و Claude از این طریق توانست به اعتبارنامهها و زیرساختهای گستردهتری دست پیدا کند.

درهمینحین، سیستم تحقیقاتی داخلی آنتروپیک نزدیک به ۹۰۰۰ هدف اینترنتی را بررسی کرده و با بهرهگیری از اعتبارنامههای افشاشده و تکنیک تزریق SQL، به برنامه یک شرکت نفوذ پیدا کرده است. برخلاف مدل Opus، این سیستم بهمحض آنکه متوجه شد هدف موردحمله به تمرین آزمایشی ربطی ندارد و یک سیستم واقعی است، عملیات را متوقف کرد.
چالشهای انطباق و همگامسازی هوش مصنوعی Claude آنتروپیک
آنتروپیک در گزارش تحلیلی خود، دو نقص رفتاری و کنترلی عمده را دلیل وقوع این رخنه دانسته است. نقص اول با نام «استدلال توجیهگرانه» به زمانی اشاره دارد که مدل شواهد و نشانههای واقعی بودن محیط را نادیده میگرفت و برای خودش توجیه میکرد که همهچیز همچنان در محیط شبیهسازی قرار دارد. مورد دوم نیز «اصرار کورکورانه و بیملاحظه برای رسیدن به هدف» اعلام شده است؛ یعنی مدل فقط و فقط روی تکمیل دستوری که گرفته بود متمرکز شده بود و پیامدها، خطرات یا واقعی بودن قربانی را کاملاً نادیده میگرفت تا کارش را تمام کند. این شرکت تأکید کرده که تکیه بر تنها یک لایه حفاظتی اشتباه بزرگی بوده و باید از چندین لایه دفاعی مستقل استفاده میشد.
آنتروپیک بهدنبال این رویدادها، فرایند ارزیابیهای خارجی را موقتاً متوقف و تستهای داخلی را محدود کرده است. اکنون یک ابزار طبقهبندی لحظهای پیادهسازی شده تا بهمحض تلاش مدل برای اسکن محیط یا خروج از محیط آزمایش، آن را متوقف کند. تستهای پرخطر نیز به محیطهای ایزولهتر منتقل شدهاند و تیمهای خارجی ارزیابی موظفاند محدوده شبکه را پیش از تست اعتبارسنجی کنند و بهطور پیوسته بر عملکرد عاملها نظارت داشته باشند.
این شرکت ریشه مشکلات را در نقصهای محیط یادگیری تقویتی نیز میداند. درهمینرابطه، بازبینیهای قبلی نشان داده بود که بیش از ۱۰ درصد از محیطهای تولیدی دارای ایراداتی نظیر هک پاداش و تنظیمات اشتباه بودهاند. این وضعیت تنها محدود به آنتروپیک نیست و OpenAI نیز پیشتر پس از خروج مدلهایش از محیط آزمایشی و دستکاری سرورهای هاگینگ فیس، مجبور به کاهش سرعت پروژههای مشابه شده بود.
نظرات کاربران