نقص امنیت Hugging Face توسط ChatGPT نشان میدهد که چرا محدودسازی هوش مصنوعی بیشتر از همیشه اهمیت دارد
AEREDIUM میگوید که امنیت هوش مصنوعی سازمانی باید از ایمنی مدل به سمت محدودسازی رمزنگاری و کنترلهای مجوز ساختاری تغییر کند.
خلاصه
- پس از حادثه OpenAI، AEREDIUM میگوید که امنیت هوش مصنوعی سازمانی باید به محدودسازی رمزنگاری متکی باشد نه به نردههای حفاظتی.
- حادثه OpenAI نیاز به محدودسازی ساختاری هوش مصنوعی فراتر از حفاظتهای رفتاری را برجسته میکند، به گفته AEREDIUM.
- کنترلهای رمزنگاری، نه فقط نردههای حفاظتی هوش مصنوعی، آینده امنیت هوش مصنوعی سازمانی را تعریف خواهند کرد، به عقیده AEREDIUM.
زمانی که OpenAI فاش کرد که یکی از مدلهای هوش مصنوعی آن از یک محیط آزمایش محدود فرار کرده و زیرساخت Hugging Face را نقض کرده است، بحث به سرعت بر روی ایمنی هوش مصنوعی متمرکز شد. سوالات آشنا بودند: آیا سیستمهای هوش مصنوعی میتوانند همراستا شوند؟ آیا میتوان به آنها اعتماد کرد؟ آیا نردههای حفاظتی امروز کافی هستند تا از رفتارهای مضر جلوگیری کنند؟
به گفته ایتان کاتز، مدیر استراتژی AEREDIUM، این سوالات درس بزرگتری را نادیده میگیرند.
"این فقط یک حادثه ایمنی هوش مصنوعی نبود،" کاتز میگوید. "این یک شکست در محدودسازی بود. هنگامی که یک عامل هوش مصنوعی به اندازه کافی توانمند میشود، نردههای حفاظتی به تنهایی کافی نیستند. سازمانها به زیرساختی نیاز دارند که بتواند بهطور رمزنگاری آنچه را که یک عامل هوش مصنوعی مجاز به انجام آن است و آنچه را که مجاز نیست، اجرا کند."
این تمایز مهم است زیرا ایمنی هوش مصنوعی و محدودسازی هوش مصنوعی مشکلات متفاوتی را حل میکنند.
ایمنی هوش مصنوعی بر تأثیرگذاری بر رفتار یک مدل متمرکز است. این سوال را میپرسد که آیا یک سیستم هوش مصنوعی میتواند درخواستهای مضر را رد کند، از تولید خروجیهای خطرناک اجتناب کند یا دستورات انسانی را دنبال کند. محدودسازی هوش مصنوعی از فرض متفاوتی شروع میشود: صرفنظر از اینکه یک عامل هوش مصنوعی چقدر توانمند یا هوشمند میشود، هرگز نباید بتواند از اختیاری که بهطور صریح به آن داده شده است، فراتر رود.
حادثه OpenAI و Hugging Face این تفاوت را نشان میدهد.
به گفته افشای خود OpenAI، ارزیابی بهطور عمدی با غیرفعال کردن طبقهبندیکنندههای تولید و کاهش رد درخواستهای سایبری انجام شد. این حادثه بهویژه آموزنده است. به جای نشان دادن یک شکست در آموزش رد، نشان میدهد که چه اتفاقی میافتد وقتی که کنترلهای ساختاری خط دفاعی اصلی میشوند. همانطور که کاتز استدلال میکند، هنگامی که فیلترهای رفتاری غایب هستند، یک عامل توانمند و هدفگرا زیرساختهای اطراف را بهعنوان سطح در دسترس تلقی میکند مگر اینکه چیزی عمیقتر از این جلوگیری کند.
به همین دلیل است که کاتز استدلال میکند که محدودسازی اساساً یک مشکل فیلتر کردن نیست.
نردههای حفاظتی مدل همچنان برای کاهش سوءاستفاده تصادفی و افزایش هزینه سوءاستفادههای عادی ارزشمند هستند. اما بهطور طبیعی احتمالی هستند و فرض میکنند که میتوان از یک سیستم هوش مصنوعی جلوگیری کرد یا آن را متقاعد کرد که اقدام نامطلوبی انجام ندهد. یک عامل بهقدر کافی توانمند که به سمت یک هدف خاص بهینهسازی میکند، ممکن است بهجای آن به دنبال راهی برای دور زدن آن کنترلها باشد. کاتز استدلال میکند که مرز امنیتی پایدار باید زیر مدل خود وجود داشته باشد.
"کنترل پایدار ساختاری است،" کاتز مینویسد. "اختیار باید زیر نقطه تصمیمگیری محدود شود، در خود کلید."
نتیجهگیری او ساده است: "یک اقدام خارج از اختیارات مسدود نمیشود. نمیتواند تولید شود."
این فلسفه پایهگذار AERPOLICE است.
بهجای تلاش برای تعیین اینکه آیا یک مدل هوش مصنوعی بهطور ایمن رفتار میکند، AERPOLICE طراحی شده است تا ارزیابی کند که آیا زیرساخت یک سازمان میتواند عوامل هوش مصنوعی خودمختار را از طریق کنترلهای ساختاری محدود کند. این چارچوب بر این تمرکز دارد که آیا اختیار بهطور رمزنگاری اجرا میشود، آیا مجوزها محدود هستند و آیا عوامل خودمختار از انجام اقداماتی که خارج از اختیارات داده شده به آنها است، منع میشوند.
برای کاتز، پیامدها فراتر از استقرارهای هوش مصنوعی خود سازمان است.
سوال دیگر فقط این نیست که آیا عوامل هوش مصنوعی شخصی قابل اعتماد هستند. سازمانها باید همچنین فرض کنند که عوامل هوش مصنوعی خارجی که بهطور فزایندهای توانمند میشوند، در نهایت با سیستمهای آنها تعامل خواهند داشت. بنابراین محدودسازی بخشی از وضعیت کلی امنیت یک سازمان میشود و تعریف میکند که زیرساخت آن چقدر میتواند در برابر عوامل خودمختار و هدفگرا مقاومت کند، صرفنظر از اینکه از کجا آمدهاند.
این همچنین نحوه تفکر سازمانها درباره مسئولیت را تغییر میدهد. امنیت دیگر نمیتواند بهطور انحصاری به رفتار مدل یا سیاستهای هر ارائهدهنده هوش مصنوعی که یک سازمان بهطور تصادفی از آن استفاده میکند، وابسته باشد. سازمانها به کنترلهایی نیاز دارند که مرزهای مجوز خود را بهطور مستقل از مدل خود اجرا کنند.
هیچیک از اینها، کاتز استدلال میکند، اهمیت ایمنی هوش مصنوعی را کاهش نمیدهد. نردهها همچنان نقش مهمی در کاهش آسیب تصادفی و بهبود کلی اکوسیستم هوش مصنوعی ایفا میکنند. اما نباید بهعنوان مرز امنیتی که سیستمهای سازمانی را محافظت میکند، اشتباه گرفته شوند.
درس وسیعتر از حادثه OpenAI و Hugging Face، به گفته کاتز، این است که امنیت هوش مصنوعی سازمانی وارد مرحله جدیدی میشود. با توانمندتر شدن عوامل هوش مصنوعی خودمختار، سازمانها بهطور فزایندهای به زیرساختی نیاز خواهند داشت که بتواند آنچه را که آن عوامل مجاز به انجام آن هستند، اجرا کند، بهجای اینکه صرفاً به آنچه که انتظار میرود انجام دهند، تکیه کنند.
آینده امنیت هوش مصنوعی سازمانی، او استدلال میکند، کمتر به اینکه آیا یک مدل هوش مصنوعی بهدرستی رفتار میکند، و بیشتر به اینکه آیا بهطور ساختاری از فراتر رفتن از اختیارات خود جلوگیری میشود، بستگی خواهد داشت.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.
ممکن است شما نیز علاقهمند باشید

چرا نقدینگی قفل شده به معنای ایمن بودن یک توکن نیست

مورگان استنلی با استفاده از ۷.۴ تریلیون دلار دارایی مشتریان و هزینههای بسیار پایین، به تصاحب رونق ارزهای دیجیتال وال استریت میپردازد

مزایای بیکاری ANSES در آگوست: مبلغ دریافتی و مقادیر جدید

معاملات خردهفروشی XRP در مکان مجاز هنگ کنگ آغاز میشود

هوش مصنوعی سرکش OpenAI چهار پلتفرم دیگر را به جز Hugging Face هک کرد

روزهای سنتی بانکداری 9 تا 5 به طور رسمی در حال مرگ است، میگویند مدیران مورگان استنلی

بانکهای آمریکا خوشبینی خود را نسبت به اقتصاد کلان آرژانتین حفظ میکنند، اما چالشهایی برای رشد هشدار میدهند

فعالسازی اصلاح XRP Ledger، مسدود کردن گرهها زیر 3.2.0

فراتر از ایتاکا: پنج فیلم که "اودیسه" را بدون اینکه متوجه شوید، اقتباس کردهاند

مورگان استنلی دامنه خدمات رمزارز خود را گسترش میدهد. بانک محصولات مبتنی بر اتریوم و سولانا را راهاندازی کرد

روجر ور بیت کوین: آیا آزادی هنوز هم دولت را آزار میدهد؟

آگوست با افزایش قیمت در حمل و نقل، اجاره، خدمات پیشپرداخت و بیشتر: تمام افزایشهایی که بر جیب مردم فشار خواهد آورد

Squeezy Dumpling چیست، اسباب بازی ویروسی که به دلیل سمی بودن از بازار خارج خواهد شد

مدیر عامل یک شرکت مهم از XRP فرار میکند. دلیل این حرکت چیست؟

مدت ثابت همچنان بدون افزایش: آنچه با سرمایهگذاری ۱.۲۰۰.۰۰۰ دلار به دست میآید

تحقیقات BloFin: نقره، 50 سال رونق و رکود

P2MR: چگونه اولین آدرس مقاوم در برابر کوانتوم بیتکوین بهطور فنی کار میکند

آلفابت: رکورد سود و بدترین نقدینگی در تاریخ خود به طور همزمان

داستان پشت پرده چگونگی تغییر تجارت ارزهای دیجیتال به واسطه یک افزایش در هنگ کنگ

Tiger Research: کیف پولهای هوش مصنوعی به میدان جدیدی در دنیای ارزهای دیجیتال تبدیل شدهاند، غولهایی مانند Coinbase پیش از این به پرداختهای خرد روی آوردهاند

شراکت جدید کاردانو وعده میدهد که دادههای خصوصی شما را به درآمد تبدیل کند، اما پرداختها احتمالاً از سالی ۱.۲۵ دلار شروع میشود

گوشه آرام سن لوئیس برای Disconnect از روزمرگی در میان سدها و کوهها

توکن طلایی: چگونه فناوری کریپتو امکان خرید یک گرم از فلز گرانبها را بدون داشتن آن در دست فراهم میکند

Dash RSI: جزئیات حرکتی که به معکوس شدن قریبالوقوع چالش میکشد

Kalshi: یک کارمند کاخ سفید پس از شرط بندی بر روی سخنرانیهای ترامپ شغل خود را از دست داد

برنشتاین هدف قیمت Circle را به ۱۴۰ دلار کاهش داد و گفت تهدید Open USD کاهش خواهد یافت

تأیید ۱۸ قربانی پس از زلزله در ژاپن: جستجوی مفقودین ادامه دارد

آیا XRP به ۱۰۰ تریلیون دلار میرسد؟ تحلیلگران بر اهمیت تضمین تأکید میکنند

چهار زن از جارد لتو، بازیگر و موسیقیدان، به اتهام جرایم جنسی شکایت کردند










