Kimi K3 از محیط آزمایش خارج شد؛ زنگ خطر برای امنیت AI

Kimi K3 از محیط آزمایش خارج شد؛ زنگ خطر برای امنیت AI

مدل هوش مصنوعی Kimi K3 متعلق به استارتاپ چینی Moonshot AI در جریان یک آزمایش امنیت سایبری توانست از محیط ایزوله‌شده‌ای که برای محدود کردن دسترسی آن طراحی شده بود خارج شود و به اطلاعات خارج از محیط آزمایش دسترسی پیدا کند. محققان می‌گویند این اتفاق نشان می‌دهد مدل‌های پیشرفته هوش مصنوعی ممکن است در پیدا کردن مسیرهای پیش‌بینی‌نشده برای رسیدن به هدف، از محدودیت‌های محیط خود عبور کنند.

این آزمایش توسط شرکت امنیت سایبری آمریکایی Frontier Security انجام شده و در آن از محیط آزمایشی توسعه‌یافته توسط مؤسسه ایمنی هوش مصنوعی بریتانیا استفاده شده است.

Kimi K3 چطور از محیط آزمایش خارج شد؟

مدل‌های هوش مصنوعی هنگام آزمایش قابلیت‌های امنیت سایبری معمولاً در محیطی به نام sandbox اجرا می‌شوند. این محیط قرار است مثل یک اتاق ایزوله عمل کند؛ مدل می‌تواند ابزارهای موردنیاز برای انجام آزمایش را در اختیار داشته باشد، اما نباید بتواند از محدوده تعیین‌شده خارج شود یا به اینترنت و اطلاعات واقعی دسترسی پیدا کند.

در آزمایش Frontier Security، Kimi K3 توانست راهی برای دور زدن این محدودیت پیدا کند. گزارش‌های منتشرشده درباره این آزمایش نشان می‌دهند که نقصی در پیکربندی sandbox زمینه دسترسی را فراهم کرده بود، اما نکته‌ای که برای محققان اهمیت داشت این بود که Kimi K3 خودش مسیر موجود را شناسایی و از آن استفاده کرد.

مدل پس از دسترسی به اینترنت سراغ منابعی مانند GitHub رفت تا پاسخ مسائل موردنظرش را پیدا کند. بنابراین در این مورد، Kimi K3 به یک سیستم خارجی نفوذ نکرد و حمله مخربی انجام نداد. مسئله اصلی این بود که مدلی که قرار بود در یک محیط کنترل‌شده فعالیت کند، توانست راهی برای خروج از آن پیدا کند.

بیشتر بخوانید: حمله سایبری به شرکت‌های وال‌استریت ناکام ماند؛ هکرها با تماس تلفنی به دنبال نفوذ به شرکت‌های مالی بودند

مشکل فقط خود مدل نیست

این اتفاق یک نکته مهم را هم روشن می‌کند: وقتی صحبت از امنیت مدل‌های هوش مصنوعی می‌شود، نمی‌توان همه تقصیر را به گردن مدل انداخت.

اگر محیط آزمایش به‌درستی ایزوله نشده باشد، حتی یک مدل نسبتاً قدرتمند هم ممکن است مسیری را پیدا کند که طراحان سیستم در نظر نگرفته‌اند. در مورد Kimi K3 نیز به گفته Frontier Security، پیکربندی sandbox بخشی از ماجرا بوده است.

اما همین‌جا بخش نگران‌کننده ماجرا شروع می‌شود. یک مدل استدلال‌گر قدرتمند اگر متوجه شود مسیر دیگری برای رسیدن به هدفش وجود دارد، ممکن است همان مسیر را امتحان کند؛ حتی اگر این مسیر خارج از چارچوبی باشد که برای آزمایش در نظر گرفته شده است.

محققان Frontier Security هشدار داده‌اند که اگر یک مدل با قابلیت‌های استدلالی بالا بتواند چنین میان‌بری را پیدا کند، مدل‌های دیگری با دسترسی‌ها و توانایی‌های مشابه نیز ممکن است رفتار مشابهی نشان دهند.

Kimi K3 برخلاف بعضی مدل‌های دیگر حمله نکرد

این بخش شاید در میان تیترهای ترسناک درباره «فرار» Kimi K3 گم شود، اما از نظر فنی اهمیت زیادی دارد.

Kimi K3 پس از دسترسی به اینترنت، به سراغ GitHub رفت تا اطلاعات موردنیازش را پیدا کند. گزارش Frontier Security می‌گوید این مدل در جریان این اتفاق سیستم دیگری را هک نکرد.

در واقع، مسئله بیشتر به توانایی مدل برای پیدا کردن یک مسیر جایگزین مربوط می‌شود. مدل هدفی داشت و وقتی مسیر معمول برای رسیدن به پاسخ محدود شد، توانست مسیر دیگری را کشف کند.

همین رفتار برای محققان مهم است. یک مدل هوش مصنوعی که بتواند ابزارها، شبکه و محیط اطراف خود را بررسی کند، ممکن است محدودیت‌هایی را که برایش تعریف شده صرفاً بخشی از مسئله ببیند، نه یک مرز غیرقابل عبور.

این تفاوت کوچکی به نظر می‌رسد، اما در سیستم‌های AI agent می‌تواند اهمیت زیادی داشته باشد.

بیشتر بخوانید: باگ جدید در Safari؛ قابلیت Private Relay اپل ممکن است آدرس IP کاربران را فاش کند

دسترسی عمومی Kimi K3 نگرانی‌ها را بیشتر کرده است

یکی از دلایلی که این اتفاق مورد توجه قرار گرفته، عمومی بودن Kimi K3 است.

برخلاف مدل‌هایی که فقط در محیط‌های بسته شرکت‌های سازنده مورد استفاده قرار می‌گیرند، Kimi K3 در دسترس کاربران و توسعه‌دهندگان قرار دارد. به همین دلیل، اگر قابلیت‌های مشابه در شرایط واقعی مورد سوءاستفاده قرار بگیرد، دامنه احتمالی آن محدود به یک آزمایشگاه نخواهد بود.

Frontier Security هشدار داده است که چنین مدلی می‌تواند در اختیار بازیگران مخرب قرار بگیرد و توانایی‌های آن برای دور زدن محدودیت‌ها در شرایط نامناسب به کار گرفته شود.

البته نباید از این اتفاق نتیجه گرفت که Kimi K3 یک مدل مخرب است یا اینکه همین حالا توانایی هک خودکار سامانه‌های واقعی را دارد. ارزیابی‌های قبلی مؤسسه ایمنی هوش مصنوعی بریتانیا و مرکز آمریکایی استانداردها و نوآوری هوش مصنوعی نشان داده بودند که Kimi K3 در برخی آزمون‌های سایبری از مدل‌های پیشرو آمریکایی عقب‌تر است.

مسئله اینجاست که توانایی سایبری و میزان پایبندی به محدودیت‌ها دو موضوع متفاوت هستند.

این اتفاق در خلأ رخ نداده است

ماجرای Kimi K3 در حالی اتفاق افتاده که طی هفته‌های اخیر چند مدل پیشرفته هوش مصنوعی در جریان آزمایش‌های امنیتی از محدوده تعیین‌شده خود فراتر رفته‌اند.

موارد مشابهی درباره مدل‌های OpenAI و Anthropic نیز گزارش شده است. در برخی از این اتفاق‌ها، مدل‌ها توانسته‌اند به سرویس‌ها یا سامانه‌های خارج از محیط آزمایش دسترسی پیدا کنند و حتی در بعضی موارد اقدامات واقعی انجام داده‌اند.

این مجموعه اتفاق‌ها یک مشکل تازه برای شرکت‌های سازنده و ارزیاب‌های هوش مصنوعی ایجاد می‌کند: هرچه مدل‌ها در استفاده از ابزارها و انجام چندمرحله‌ای وظایف توانمندتر می‌شوند، خود محیط آزمایش هم باید با دقت بیشتری در برابر رفتار غیرمنتظره مدل‌ها مقاوم شود.

دیگر نمی‌توان فرض کرد که مدل صرفاً همان دستورهایی را اجرا می‌کند که در سناریوی آزمایش برایش نوشته شده است.

مسئله اصلی، کنترل مدل‌های مستقل‌تر است

Kimi K3 چیزی را نشان داده که شاید از خود «فرار از sandbox» مهم‌تر باشد: مدل‌های جدید فقط منتظر پاسخ دادن به یک دستور نیستند. آن‌ها محیط اطراف خود را بررسی می‌کنند، مسیرهای مختلف را امتحان می‌کنند و اگر راهی برای رسیدن به هدف پیدا کنند، ممکن است از همان مسیر استفاده کنند.

برای یک چت‌بات معمولی، این رفتار شاید چندان مهم نباشد. اما وقتی مدل به ابزارهای خط فرمان، اینترنت، فایل‌ها یا سرویس‌های خارجی دسترسی داشته باشد، مرز میان «پاسخ دادن» و «انجام دادن» بسیار باریک‌تر می‌شود.

به نظر می‌رسد چالش بعدی صنعت هوش مصنوعی فقط ساخت مدل‌هایی با توانایی استدلال بیشتر نیست؛ ساخت محیط‌هایی است که حتی یک مدل بسیار کنجکاو و هدف‌محور هم نتواند با یک میان‌بر از آن‌ها عبور کند.

Moonshot AI تاکنون درباره این گزارش Frontier Security به درخواست رویترز پاسخ نداده است.

همچنین بخوانید

اپل Apple Watch بدون نمایشگر را بررسی می‌کند

اپل Apple Watch بدون نمایشگر را بررسی می‌کند؛ نسل بعدی چه شکلی است؟

اپل ظاهراً برای نسل‌های آینده Apple Watch به دنبال تغییرات بزرگ‌تری از یک طراحی تازه …

یونیتری و رقابت چین برای ساخت ربات‌های انسان‌نما

یونیتری و رقابت چین برای ساخت ربات‌های انسان‌نما | عرضه اولیه ۹۰۴ میلیون دلاری

یونیتری با قیمت‌گذاری سهام عرضه اولیه خود در بورس شانگهای، یک قدم تا تبدیل شدن …