Loader
ما را پیدا کنید
آگهی

آیا «موضوعات ممنوعه» راز متوقف کردن هکرهای هوش مصنوعی است؟

آرشیو - صفحه تلویزیون عبارت «آگاه‌سازی نهادهای عمومی و مردم درباره امنیت سایبری» را در مجمع بین‌المللی امنیت سایبری در لیل فرانسه، ۲ ژانویه ۲۰۱۸ نمایش می‌دهد
عکس آرشیوی - روی صفحه تلویزیون در انجمن بین‌المللی امنیت سایبری لیل فرانسه، ۲ ژانویه ۲۰۱۸ نوشته شده «آگاه‌سازی سازمان‌های دولتی و مردم درباره امنیت سایبری» Copyright  AP Photo
Copyright AP Photo
نگارش از Una Hajdari
تاریخ انتشار
همرسانی نظرها یورونیوز را در گوگل دنبال کنید
همرسانی Close Button

راه متوقف‌کردن یک حمله سایبری مبتنی بر هوش‌مصنوعی شاید به همین سادگی یعنی مطرح‌کردن موضوعی باشد که سیستم اجازه بحث درباره آن را ندارد.

پژوهشگران با استفاده از همان حقه‌ای که هکرها همین حالا علیه سامانه‌های هوش مصنوعی به کار می‌برند، به روشی عجیب اما موثر برای متوقف کردن یک عامل هک‌کننده مبتنی بر هوش مصنوعی دست یافته‌اند.

آگهی
آگهی

نکته مهم این است که این روش از ترمزهای ایمنی درونی یا موضوعات ممنوعه‌ای استفاده می‌کند که سامانه‌های بزرگ هوش مصنوعی در جهان به آنها تکیه دارند؛ برای نمونه، کلود پرسش‌هایی را که به ساخت سلاح‌های بیولوژیک مربوط می‌شود متوقف می‌کند و مدل‌های هوش مصنوعی ساخت چین موضوعات سیاسی حساسی مانند میدان تیان‌آن‌من را نادیده می‌گیرند، و همین سازوکار برای متوقف کردن یک حمله سایبری مبتنی بر هوش مصنوعی به کار گرفته می‌شود.

رقابت با ماشین

این تکنیک را شرکت امنیتی تریسبیت مستقر در لندن طراحی کرده و بر پایه پژوهشی بنا شده که این شرکت در ماه مه منتشر کرد.

آن زمان، تریسبیت یک شبکه شرکتی جعلی در اختیار ده مدل پیشرو هوش مصنوعی گذاشت تا به آن نفوذ کنند؛ شبکه‌ای که حفره‌های امنیتی واقعی داشت و اجازه داد این مدل‌ها به عنوان مهاجمان خودکار آزادانه عمل کنند.

درون آن شبکه، طعمه‌هایی پنهان شده بود که «قناری» نام داشتند و طوری طراحی شده بودند که شبیه گذرواژه‌ها و نام‌های کاربری واقعی به نظر برسند. به محض دست زدن به یکی از آنها، مدافعان یک هشدار دریافت می‌کردند.

نتایج امیدوارکننده بود. در مجموع ۹۵۱ تلاش برای حمله، این قناری‌ها در ۹۵٫۹ درصد موارد پیش از آنکه هوش مصنوعی به سطح دسترسی مدیر سیستم برسد، به مدافعان هشدار دادند؛ با یک فاصله زمانی میانه برابر با هشت دقیقه.

با این حال هشت دقیقه زمان زیادی نیست وقتی باید واکنش نشان داد و حمله را متوقف کرد. مدل‌های هوش مصنوعی به طور میانگین به ۱۴ دقیقه برای نفوذ کامل نیاز داشتند، بنابراین هشدار هشت‌دقیقه‌ای یعنی تیم امنیت فقط حدود شش دقیقه وقت دارد تا متوجه هشدار شود، تشخیص دهد چه رخ می‌دهد و جلوی آن را بگیرد.

در برابر سامانه‌ای که با سرعت ماشین حرکت می‌کند، این عملا زمانی بسیار اندک است.

اما اگر سامانه‌های هوش مصنوعی طوری برنامه‌ریزی شده باشند که هنگام مواجهه با برخی دستورهای متنی سیاسی حساس از کار بیفتند، این حقه می‌تواند واقعا کارساز باشد.

یک توسعه‌دهنده می‌تواند مدلی را دوباره آموزش دهد تا نسبت به پرسش‌های امنیتی کمتر سخت‌گیر باشد، اما حذف محدودیت‌های سیاسی‌ای که به دلایل مقرراتی یا سیاست‌گذاری درون سیستم نهادینه شده، به مراتب دشوارتر است.

این موضوعات سیاسی حساس یا مرتبط با امنیت، خطای نرم‌افزاری قابل رفع نیستند؛ بلکه انتخابی آگاهانه در طراحی‌اند که توسعه‌دهنده ناچار است آنها را حفظ کند.

استفاده از حقه خود هکرها علیه آنها

تزریق پرامپت تا امروز بیشتر سلاحی بوده که خود مهاجمان از آن استفاده کرده‌اند.

با پنهان کردن یک دستور درون ایمیل، صفحه وب یا دعوت‌نامه تقویم، عاملی مبتنی بر هوش مصنوعی که آن متن را می‌خواند ممکن است به جای انجام وظیفه اصلی‌اش همان فرمان پنهان را اجرا کند.

از این روش پیشتر مستقیما علیه سامانه‌های دفاعی هوش مصنوعی هم استفاده شده است؛ بدافزارهایی ساخته شده‌اند تا ابزارهای پویش مبتنی بر هوش مصنوعی را فریب دهند و آنها را وادار کنند که بدافزار را بی‌ضرر اعلام کنند، فقط با گنجاندن متنی که برای سردرگم کردن هوش مصنوعیِ خواننده طراحی شده است.

تریسبیت تصمیم گرفت این ایده را وارونه کند. این شرکت به جای طعمه‌هایی که صرفا هشدار می‌دادند، بخش‌های کوتاهی از متن را درون اسرار جعلی خود قرار داد؛ متن‌هایی که طوری نوشته شده بودند که هر مهاجم هوش مصنوعی را به سمت موضوعی سوق دهند که قواعد ایمنی خودش اجازه نمی‌دهد به آن ورود کند.

وقتی هوش مصنوعی هنگام جست‌وجوی سامانه به آن متن می‌رسد، سازوکارهای حفاظتی درونی‌اش فعال می‌شود و به سادگی متوقف می‌شود. تریسبیت این روش را «بمب زمینه» می‌نامد.

این حقه باید برای هر مدل هوش مصنوعی به طور جداگانه تنظیم می‌شد. محتوایی که به سلاح‌های خطرناک بیولوژیک اشاره می‌کرد، به طور قابل اعتماد مدل‌های غربی را متوقف می‌کرد.

آیا واقعا کار کرد؟

تریسبیت این آزمایش را روی پنج مدل پیشرو هوش مصنوعی انجام داد: اوپوس ۴٫۸، جمنای ۳٫۱ پرو، جی‌ال‌ام ۵٫۲، دیپ‌سیک ۴ پرو و کیمی ۲٫۶. در ۱۵۲ تلاش برای حمله، نتایج چشمگیر بود.

سهم اجراهایی که به سطح دسترسی مدیر سیستم می‌رسیدند از ۵۷ درصد به ۵ درصد کاهش یافت. نفوذ کامل، یعنی دسترسی مدیر سیستم همراه با جای پای پایدار در سامانه، از ۳۶ درصد به ۱ درصد رسید.

اجراهایی که دست‌کم بخشی از حمله را به پایان رسانده بودند از ۹۱ درصد به ۱۵ درصد کاهش یافت. و مهم‌تر از همه، همه اجراهایی که شامل بمب زمینه بودند، حتی آنهایی که در نفوذ ناکام ماندند، پیش از هر چیز یک هشدار قناری را فعال کردند.

اوپوس ۴٫۸ روشن‌ترین نمونه بود. این مدل همچنین قدرتمندترین مهاجم گروه به شمار می‌رفت و در ۹۳ درصد اجراهایی که بمب زمینه در آنها نبود به سطح دسترسی مدیر سیستم می‌رسید. اما به محض افزودن یک بمب زمینه، هر بار ناکام ماند.

این روش چه چیزی را حل نمی‌کند

هیچ‌کس در تریسبیت ادعا نمی‌کند که این روش مشکل تزریق پرامپت را برای همیشه حل می‌کند.

هنوز راه واقعی‌ای برای جلوگیری کامل از این وجود ندارد که مدل‌های هوش مصنوعی گاه‌وبیگاه یک دستور را با داده معمولی اشتباه بگیرند؛ و همین نقص دقیقا همان چیزی است که این تکنیک بر آن تکیه دارد.

این روش همچنین جایگزین پژوهش قبلی درباره قناری‌ها نمی‌شود.

این دو قرار است در کنار هم عمل کنند: مطالعه ماه مه برای مدافعان هشدار هشت‌دقیقه‌ای فراهم می‌کند و بمب زمینه تلاش می‌کند با متوقف کردن حمله پیش از پایان آن بازه هشدار، زمان بیشتری برای آنها بخرد.

رفتن به میانبرهای دسترسی
همرسانی نظرها یورونیوز را در گوگل دنبال کنید

مطالب مرتبط

پژوهشگران: ویدیوهای ساختگی حیوانات با هوش مصنوعی درک ما از حیات‌وحش را مخدوش می‌کنند

آنتروپیک در بزرگترین توافق حق‌تالیف ۱.۳ میلیارد یورو می‌پردازد

مدل هوش مصنوعی چینی Kimi K3 ثبت‌نام جدید را با جهش تقاضا متوقف کرد