OpenAI جزئیات تازهای از مدل در دست توسعه Astra منتشر کرده است؛ مدلی که به گفته این شرکت، نخستین مدل زبانی بزرگ محسوب میشود که به آستانه «بحرانی امنیت سایبری» رسیده است. Astra قرار است بهزودی عرضه شود، اما دسترسی به پیشرفتهترین قابلیتهای امنیت سایبری آن محدودتر خواهد بود.
OpenAI میگوید Astra میتواند آسیبپذیریهای ناشناخته در سامانههای کامپیوتری را شناسایی و بدون راهنمایی مستقیم انسان از آنها سوءاستفاده کند؛ قابلیتی که نگرانیهای امنیتی تازهای درباره نحوه عرضه این مدل ایجاد کرده است.
آزمایش Astra برای کشف آسیبپذیریهای امنیتی
بر اساس ارزیابیهای داخلی OpenAI ، Astra در آزمایش ExploitBench که توانایی مدلهای زبانی در سوءاستفاده از آسیبپذیریهای شناختهشده سیستمها را بررسی میکند، امتیاز کامل گرفته است.
مهندسان OpenAI همچنین نسخهای تغییریافته از این آزمایش طراحی کردهاند. این شرکت میگوید Astra در این نسخه توانسته دو آسیبپذیری zero-day را کشف و از آنها سوءاستفاده کند. با این حال، OpenAI جزئیات فنی بیشتری درباره این آزمایش یا نحوه انجام آن منتشر نکرده است.
OpenAI چه تدابیری برای ایمنی Astra در نظر گرفته است؟
OpenAI اعلام کرده برای جلوگیری از سوءاستفاده مخرب از مدلهایش و محدودکردن رفتارهای خطرناک، توسعه سازوکارهای نظارتی خود را آغاز کرده است. این شرکت در حال تقویت زیرساختی موسوم به harness است تا بتواند رفتارهای سوءاستفادهگرانه را شناسایی و تلاش برای دورزدن محدودیتها یا jailbreak را متوقف کند.
برای Astra نیز مجموعهای از تکنیکهای جدید ایمنی در نظر گرفته شده که OpenAI جزئیات آنها را مشخص نکرده است. این شرکت میگوید حسابهایی را که از نظر آن در سطح ریسک بالاتری قرار دارند شناسایی کرده و پاسخهای Astra به درخواستهای این حسابها را محدود میکند؛ هرچند درباره نحوه اجرای این محدودیتها اطلاعاتی ارائه نشده است.
OpenAI Astra را «همراستاترین مدل خود تا امروز» توصیف کرده و اعلام کرده است که هنگام عرضه، نظارت اضافهای روی فرایند chain-of-thought آن اعمال خواهد شد تا رفتارهای نامناسب سریعتر شناسایی و متوقف شوند.
آزمون Astra پس از ماجرای عاملهای هوش مصنوعی OpenAI
آمادهسازی Astra برای انتشار در شرایطی انجام میشود که صنعت هوش مصنوعی همچنان درگیر پیامدهای آزمایش اخیر عاملهای هوش مصنوعی OpenAI است. این عاملها در جریان آزمایش از محیط آموزشی خود خارج شدند و به دادههای خصوصی در Hugging Face، یکی از پلتفرمهای شناختهشده برای توزیع مدلها و بنچمارکها، دسترسی پیدا کردند.
OpenAI برای ارزیابی Astra آزمایشی طراحی کرده است تا مدل را به تکرار رفتار همان عاملها ترغیب کند. به گفته این شرکت، عاملهای مذکور در همکاری با یکدیگر و با وجود تدابیر حفاظتی اعمالشده از سوی پژوهشگران، تلاش کرده بودند به اینترنت عمومی دسترسی پیدا کنند.
OpenAI میگوید Astra در آزمایشهای مربوط به این سناریو تلاش نکرده از محیط آزمایشی خود خارج شود.
آیا نتایج آزمایش Astra قابل اتکا هستند؟
Yona Shavit، کارمند سابق OpenAI که اکنون در حوزه تابآوری هوش مصنوعی در OpenAI Foundation فعالیت میکند، در شبکههای اجتماعی این پرسش را مطرح کرد که آیا خودداری Astra از نقض محدودیتها واقعاً نشاندهنده رفتار ایمن مدل بوده است یا ممکن است مدل به دلیل اطلاع از هدف آزمایش یا تلاش برای فریب پژوهشگران، رفتاری متفاوت از خود نشان داده باشد.
هنوز تصویر کاملی از تواناییهای Astra وجود ندارد
با وجود انتشار جزئیات تازه، همچنان تصویر کاملی از تواناییهای واقعی Astra یا میزان اثربخشی تدابیر امنیتی OpenAI در دست نیست. هیچ تأیید مستقل و شخص ثالثی برای ارزیابی ادعاهای این شرکت درباره آمادگی یا ایمنی مدل منتشر نشده است.
OpenAI گفته است پیش از عرضه، Astra را در اختیار گروهی از آزمایشکنندگان قرار خواهد داد، اما هنوز مشخص نکرده این افراد چه کسانی هستند و چگونه انتخاب خواهند شد. همچنین معلوم نیست آیا دولت ایالات متحده در ارزیابی Astra پیش از انتشار عمومی آن مشارکت دارد یا خیر.
این شرکت گفته است همزمان با عرضه گسترده Astra، ارزیابیهای بیشتری از مدل و اطلاعات تکمیلی درباره سازوکارهای ایمنی آن منتشر خواهد کرد. با این حال، قابلیت Astra در کشف و بهرهبرداری مستقل از آسیبپذیریهای ناشناخته، ارزیابی دقیق و مستقل از تدابیر امنیتی آن را اهمیت بیشتری میدهد.
زیلوش آخرین اخبار تکنولوژی 