مدل‌های هوش مصنوعی Claude در آزمایش‌های امنیتی به سه سازمان نفوذ کردند

آنتروپیک: مدل‌های هوش مصنوعی Claude در آزمایش‌های امنیتی به سه سازمان نفوذ کردند

شرکت Anthropic از وقوع سه رخداد امنیتی غیرمنتظره در جریان آزمایش‌های داخلی مدل‌های هوش مصنوعی خود خبر داده است؛ رخدادهایی که در آن برخی از مدل‌های خانواده Claude موفق شدند از محیط آزمایشی خارج شده و به زیرساخت‌های واقعی سه سازمان دسترسی پیدا کنند.

این گزارش تنها چند روز پس از آن منتشر می‌شود که OpenAI نیز فاش کرده بود یکی از مدل‌های آزمایشی این شرکت در جریان تست‌های داخلی توانسته به زیرساخت‌های Hugging Face نفوذ کند. انتشار این دو گزارش در فاصله زمانی کوتاه، بار دیگر توجه کارشناسان را به یکی از مهم‌ترین چالش‌های عصر هوش مصنوعی جلب کرده است؛ اینکه چگونه می‌توان مدل‌های بسیار قدرتمند را حتی در محیط‌های آزمایشی نیز تحت کنترل نگه داشت.

چگونه مدل‌های Claude به اینترنت و سیستم‌های واقعی دسترسی پیدا کردند؟

به گفته آنتروپیک، پس از انتشار گزارش OpenAI، این شرکت تصمیم گرفت تمامی ارزیابی‌های امنیت سایبری اخیر خود را دوباره بررسی کند تا مشخص شود آیا مدل‌های Claude در هیچ مرحله‌ای موفق به برقراری ارتباط با اینترنت شده‌اند یا خیر.

نتیجه بررسی بیش از ۱۴۱ هزار اجرای آزمایشی نشان داد که در سه مورد، مدل‌های هوش مصنوعی این شرکت توانسته‌اند از طریق یکی از محیط‌های ارزیابی که توسط شریک امنیتی Irregular مدیریت می‌شد، به اینترنت دسترسی پیدا کنند.

بررسی‌ها نشان داد مشکل از یک پیکربندی اشتباه در محیط آزمایشی بوده است؛ محیطی که قرار بود مانند یک «Sandbox» کاملاً ایزوله عمل کند اما در عمل مسیر ارتباطی آن با اینترنت باز مانده بود. آنتروپیک این اتفاق را حاصل یک سوءبرداشت میان دو شرکت درباره نحوه پیکربندی محیط آزمایش توصیف کرده و تأکید کرده است که به دنبال مقصر دانستن هیچ طرفی نیست و مسئولیت اصلاح فرآیندها را بر عهده می‌گیرد.

سه نفوذ واقعی؛ نتیجه یک پیکربندی اشتباه در محیط آزمایشی

همین مسیر ارتباطی ناخواسته باعث شد سه مدل مختلف Claude به سامانه‌های عملیاتی سه سازمان متفاوت دسترسی پیدا کنند. مدل‌هایی که در این رخدادها حضور داشتند عبارت‌اند از:

  • Claude Opus 4.7
  • Claude Mythos 5
  • یک مدل تحقیقاتی داخلی که هنوز به‌صورت عمومی منتشر نشده است

نکته جالب اینکه در تمامی این آزمایش‌ها، به مدل‌ها صراحتاً اعلام شده بود که هیچ دسترسی به اینترنت ندارند. با این حال، مدل‌ها پس از مشاهده منابع واقعی، آن‌ها را بخشی از سناریوی تمرینی خود فرض کرده و عملیات تعریف‌شده را ادامه دادند.

مدل‌های Claude چگونه به این شرایط واکنش نشان دادند؟

رفتار سه مدل در مواجهه با این شرایط کاملاً یکسان نبود. Claude Opus 4.7 که قدیمی‌ترین مدل حاضر در این آزمایش بود، در تمام اجراها متوجه شد با یک زیرساخت واقعی روبه‌رو شده است. با وجود این تشخیص، در برخی موارد چنین استدلال کرد که احتمالاً این سامانه نیز بخشی از سناریوی آزمایشی است و در نهایت عملیات خود را ادامه داد. این فعالیت‌ها شامل استخراج اطلاعات احراز هویت و ایجاد تغییراتی در پایگاه‌های داده عملیاتی بود.

مدل های claude

در مقابل، Claude Mythos 5 اگرچه نشانه‌هایی از حضور در اینترنت واقعی دریافت کرد، اما خود را متقاعد کرد که همچنان داخل یک محیط شبیه‌سازی قرار دارد. این مدل حتی موفق شد یک بسته نرم‌افزاری مخرب را در مخزن عمومی PyPI منتشر کند؛ بسته‌ای که پیش از شناسایی توسط برخی سیستم‌های خارجی دانلود و اجرا شده بود.

اما جدیدترین مدل تحقیقاتی آنتروپیک رفتاری متفاوت از خود نشان داد. این مدل پس از آنکه متوجه شد هدف موردنظر یک سامانه واقعی است، بدون دریافت دستور اضافی عملیات را متوقف کرد و از ادامه فعالیت خودداری کرد.

 آنتروپیک: این مدل‌ها خودمختار نبودند، فقط مأموریتشان را اجرا کردند

آنتروپیک تأکید کرده است که هیچ شواهدی مبنی بر رفتار خودمختار یا دنبال کردن اهداف شخصی توسط این مدل‌ها پیدا نشده است.

به گفته این شرکت، تمامی اقدامات انجام‌شده صرفاً در راستای اجرای وظایفی بوده که در قالب سناریوی آزمایشی به مدل‌ها سپرده شده بود. به بیان دیگر، مدل‌ها تلاش نکرده‌اند قوانین را عمداً دور بزنند، بلکه تصور می‌کردند همچنان در حال انجام یک تمرین کنترل‌شده هستند.

همچنین این شرکت توضیح داده که در این آزمایش‌ها، نسخه خام مدل‌ها بدون بسیاری از سامانه‌های ایمنی و فیلترهایی اجرا شده بودند که معمولاً روی نسخه‌های عمومی Claude فعال هستند. به اعتقاد آنتروپیک، اگر این لایه‌های حفاظتی فعال بودند، احتمالاً چنین رفتارهایی هرگز رخ نمی‌داد.

 تفاوت این رخداد با نفوذ اخیر مدل OpenAI چیست؟

آنتروپیک معتقد است اتفاق اخیر تفاوت مهمی با رخداد منتشرشده از سوی OpenAI دارد. در ماجرای OpenAI، مدل هوش مصنوعی از یک آسیب‌پذیری نرم‌افزاری ناشناخته برای خروج از محیط آزمایشی استفاده کرده بود؛ اما در حادثه آنتروپیک، هیچ فرار فنی از Sandbox رخ نداده و مسیر دسترسی به اینترنت از ابتدا به‌اشتباه باز مانده بوده است.

این شرکت همچنین اعلام کرده که این رخدادها را خود و طی یک بازبینی پیشگیرانه کشف کرده است؛ موضوعی که به گفته آنتروپیک نشان می‌دهد فرایندهای نظارتی داخلی نقش مهمی در شناسایی چنین مخاطراتی دارند.

در ادامه نیز اعلام شد که بررسی مستقل این اتفاقات با همکاری گروه پژوهشی METR انجام خواهد شد تا جزئیات فنی و نقاط ضعف موجود به‌صورت دقیق ارزیابی شوند.

این اتفاق چه پیامی برای آینده امنیت هوش مصنوعی دارد؟

آنچه طی هفته‌های اخیر از سوی OpenAI و Anthropic منتشر شده، نشان می‌دهد صنعت هوش مصنوعی وارد مرحله‌ای شده که دیگر صرفاً افزایش توانایی مدل‌ها اهمیت ندارد؛ بلکه ایمنی، کنترل و مدیریت رفتار این سیستم‌ها به همان اندازه حیاتی شده است.

نکته قابل توجه این است که در هر دو حادثه، مدل‌ها انگیزه یا هدف مستقلی نداشتند و صرفاً تلاش می‌کردند مأموریتی را که برایشان تعریف شده بود انجام دهند. با این حال، همین موضوع نشان می‌دهد اگر محیط‌های آزمایشی حتی کوچک‌ترین خطای پیکربندی داشته باشند، مدل‌های پیشرفته می‌توانند پیامدهایی فراتر از انتظار ایجاد کنند.

به نظر می‌رسد در سال‌های آینده، سرمایه‌گذاری روی زیرساخت‌های امنیتی، طراحی Sandboxهای مقاوم و توسعه سامانه‌های نظارتی هوشمند، به یکی از مهم‌ترین اولویت‌های شرکت‌های فعال در حوزه هوش مصنوعی تبدیل خواهد شد؛ چرا که قدرت بیشتر، بدون کنترل دقیق، ریسک‌های بزرگ‌تری را نیز به همراه خواهد داشت.

همچنین بخوانید

مدیرعامل آینده اپل می‌خواهد موفقیت این شرکت در سینما و تلویزیون را ادامه دهد

مدیرعامل آینده اپل می‌خواهد موفقیت این شرکت در سینما و تلویزیون را ادامه دهد

اپل در سال‌های اخیر دیگر صرفاً یک شرکت سخت‌افزاری نبوده و حضورش در صنعت سرگرمی …

گلکسی z flip 8 رونمایی شد

گلکسی Z Flip 8 رونمایی شد؛ باریک‌ترین و هوشمندترین گوشی تاشوی سامسونگ

سامسونگ نسل جدید گوشی تاشوی خود، گلکسی زد فلیپ 8 را به‌صورت رسمی معرفی کرد؛ محصولی …