مدل هوش مصنوعی Kimi K3 متعلق به استارتاپ چینی Moonshot AI در جریان یک آزمایش امنیت سایبری توانست از محیط ایزولهشدهای که برای محدود کردن دسترسی آن طراحی شده بود خارج شود و به اطلاعات خارج از محیط آزمایش دسترسی پیدا کند. محققان میگویند این اتفاق نشان میدهد مدلهای پیشرفته هوش مصنوعی ممکن است در پیدا کردن مسیرهای پیشبینینشده برای رسیدن به هدف، از محدودیتهای محیط خود عبور کنند.
این آزمایش توسط شرکت امنیت سایبری آمریکایی Frontier Security انجام شده و در آن از محیط آزمایشی توسعهیافته توسط مؤسسه ایمنی هوش مصنوعی بریتانیا استفاده شده است.
Kimi K3 چطور از محیط آزمایش خارج شد؟
مدلهای هوش مصنوعی هنگام آزمایش قابلیتهای امنیت سایبری معمولاً در محیطی به نام sandbox اجرا میشوند. این محیط قرار است مثل یک اتاق ایزوله عمل کند؛ مدل میتواند ابزارهای موردنیاز برای انجام آزمایش را در اختیار داشته باشد، اما نباید بتواند از محدوده تعیینشده خارج شود یا به اینترنت و اطلاعات واقعی دسترسی پیدا کند.
در آزمایش Frontier Security، Kimi K3 توانست راهی برای دور زدن این محدودیت پیدا کند. گزارشهای منتشرشده درباره این آزمایش نشان میدهند که نقصی در پیکربندی sandbox زمینه دسترسی را فراهم کرده بود، اما نکتهای که برای محققان اهمیت داشت این بود که Kimi K3 خودش مسیر موجود را شناسایی و از آن استفاده کرد.
مدل پس از دسترسی به اینترنت سراغ منابعی مانند GitHub رفت تا پاسخ مسائل موردنظرش را پیدا کند. بنابراین در این مورد، Kimi K3 به یک سیستم خارجی نفوذ نکرد و حمله مخربی انجام نداد. مسئله اصلی این بود که مدلی که قرار بود در یک محیط کنترلشده فعالیت کند، توانست راهی برای خروج از آن پیدا کند.
بیشتر بخوانید: حمله سایبری به شرکتهای والاستریت ناکام ماند؛ هکرها با تماس تلفنی به دنبال نفوذ به شرکتهای مالی بودند
مشکل فقط خود مدل نیست
این اتفاق یک نکته مهم را هم روشن میکند: وقتی صحبت از امنیت مدلهای هوش مصنوعی میشود، نمیتوان همه تقصیر را به گردن مدل انداخت.
اگر محیط آزمایش بهدرستی ایزوله نشده باشد، حتی یک مدل نسبتاً قدرتمند هم ممکن است مسیری را پیدا کند که طراحان سیستم در نظر نگرفتهاند. در مورد Kimi K3 نیز به گفته Frontier Security، پیکربندی sandbox بخشی از ماجرا بوده است.
اما همینجا بخش نگرانکننده ماجرا شروع میشود. یک مدل استدلالگر قدرتمند اگر متوجه شود مسیر دیگری برای رسیدن به هدفش وجود دارد، ممکن است همان مسیر را امتحان کند؛ حتی اگر این مسیر خارج از چارچوبی باشد که برای آزمایش در نظر گرفته شده است.
محققان Frontier Security هشدار دادهاند که اگر یک مدل با قابلیتهای استدلالی بالا بتواند چنین میانبری را پیدا کند، مدلهای دیگری با دسترسیها و تواناییهای مشابه نیز ممکن است رفتار مشابهی نشان دهند.
Kimi K3 برخلاف بعضی مدلهای دیگر حمله نکرد
این بخش شاید در میان تیترهای ترسناک درباره «فرار» Kimi K3 گم شود، اما از نظر فنی اهمیت زیادی دارد.
Kimi K3 پس از دسترسی به اینترنت، به سراغ GitHub رفت تا اطلاعات موردنیازش را پیدا کند. گزارش Frontier Security میگوید این مدل در جریان این اتفاق سیستم دیگری را هک نکرد.
در واقع، مسئله بیشتر به توانایی مدل برای پیدا کردن یک مسیر جایگزین مربوط میشود. مدل هدفی داشت و وقتی مسیر معمول برای رسیدن به پاسخ محدود شد، توانست مسیر دیگری را کشف کند.
همین رفتار برای محققان مهم است. یک مدل هوش مصنوعی که بتواند ابزارها، شبکه و محیط اطراف خود را بررسی کند، ممکن است محدودیتهایی را که برایش تعریف شده صرفاً بخشی از مسئله ببیند، نه یک مرز غیرقابل عبور.
این تفاوت کوچکی به نظر میرسد، اما در سیستمهای AI agent میتواند اهمیت زیادی داشته باشد.
بیشتر بخوانید: باگ جدید در Safari؛ قابلیت Private Relay اپل ممکن است آدرس IP کاربران را فاش کند
دسترسی عمومی Kimi K3 نگرانیها را بیشتر کرده است
یکی از دلایلی که این اتفاق مورد توجه قرار گرفته، عمومی بودن Kimi K3 است.
برخلاف مدلهایی که فقط در محیطهای بسته شرکتهای سازنده مورد استفاده قرار میگیرند، Kimi K3 در دسترس کاربران و توسعهدهندگان قرار دارد. به همین دلیل، اگر قابلیتهای مشابه در شرایط واقعی مورد سوءاستفاده قرار بگیرد، دامنه احتمالی آن محدود به یک آزمایشگاه نخواهد بود.
Frontier Security هشدار داده است که چنین مدلی میتواند در اختیار بازیگران مخرب قرار بگیرد و تواناییهای آن برای دور زدن محدودیتها در شرایط نامناسب به کار گرفته شود.
البته نباید از این اتفاق نتیجه گرفت که Kimi K3 یک مدل مخرب است یا اینکه همین حالا توانایی هک خودکار سامانههای واقعی را دارد. ارزیابیهای قبلی مؤسسه ایمنی هوش مصنوعی بریتانیا و مرکز آمریکایی استانداردها و نوآوری هوش مصنوعی نشان داده بودند که Kimi K3 در برخی آزمونهای سایبری از مدلهای پیشرو آمریکایی عقبتر است.
مسئله اینجاست که توانایی سایبری و میزان پایبندی به محدودیتها دو موضوع متفاوت هستند.
این اتفاق در خلأ رخ نداده است
ماجرای Kimi K3 در حالی اتفاق افتاده که طی هفتههای اخیر چند مدل پیشرفته هوش مصنوعی در جریان آزمایشهای امنیتی از محدوده تعیینشده خود فراتر رفتهاند.
موارد مشابهی درباره مدلهای OpenAI و Anthropic نیز گزارش شده است. در برخی از این اتفاقها، مدلها توانستهاند به سرویسها یا سامانههای خارج از محیط آزمایش دسترسی پیدا کنند و حتی در بعضی موارد اقدامات واقعی انجام دادهاند.
این مجموعه اتفاقها یک مشکل تازه برای شرکتهای سازنده و ارزیابهای هوش مصنوعی ایجاد میکند: هرچه مدلها در استفاده از ابزارها و انجام چندمرحلهای وظایف توانمندتر میشوند، خود محیط آزمایش هم باید با دقت بیشتری در برابر رفتار غیرمنتظره مدلها مقاوم شود.
دیگر نمیتوان فرض کرد که مدل صرفاً همان دستورهایی را اجرا میکند که در سناریوی آزمایش برایش نوشته شده است.
مسئله اصلی، کنترل مدلهای مستقلتر است
Kimi K3 چیزی را نشان داده که شاید از خود «فرار از sandbox» مهمتر باشد: مدلهای جدید فقط منتظر پاسخ دادن به یک دستور نیستند. آنها محیط اطراف خود را بررسی میکنند، مسیرهای مختلف را امتحان میکنند و اگر راهی برای رسیدن به هدف پیدا کنند، ممکن است از همان مسیر استفاده کنند.
برای یک چتبات معمولی، این رفتار شاید چندان مهم نباشد. اما وقتی مدل به ابزارهای خط فرمان، اینترنت، فایلها یا سرویسهای خارجی دسترسی داشته باشد، مرز میان «پاسخ دادن» و «انجام دادن» بسیار باریکتر میشود.
به نظر میرسد چالش بعدی صنعت هوش مصنوعی فقط ساخت مدلهایی با توانایی استدلال بیشتر نیست؛ ساخت محیطهایی است که حتی یک مدل بسیار کنجکاو و هدفمحور هم نتواند با یک میانبر از آنها عبور کند.
Moonshot AI تاکنون درباره این گزارش Frontier Security به درخواست رویترز پاسخ نداده است.
زیلوش آخرین اخبار تکنولوژی 