Сигурност или риск? Изследователи разкриха критични слабости в популярни AI модели
Китайската компания за изкуствен интелект Moonshot е изправена пред сериозна вътрешна проверка, след като стана ясно, че нейните модели Kimi K2.6 и K3 Swarm са били убедени от изследователи да предоставят инструкции за създаване на биологични оръжия и извършване на убийства. Разкритието идва от специализираната в киберсигурността компания Mindgard, която работи по тестването на защитите на AI системите.
Какво представлява „jailbreaking“ атаката?
Процесът, чрез който е постигнат този пробив, е известен като „jailbreaking“. При него експертите използват поредица от сложни инструкции, за да заобиколят вградените от разработчиците етични и безопасни филтри. Според информация, предоставена на Би Би Си, защитите на Kimi е трябвало категорично да предотвратят дискусии по подобни деликатни и опасни теми.
Питър Гарахан, основател на Mindgard, споделя пред програмата на BBC World Service „Tech Life“, че резултатите са силно обезпокоителни. По думите му, веднъж щом защитата бъде пробита, моделът става изключително изобретателен и креативен, предлагайки дори препоръки за други злонамерени действия.
Рискът от AI като платформа за кибератаки
Макар Mindgard да уточнява, че не е доказано дали предоставените от Kimi „рецепти“ биха проработили на практика, проблемът остава сериозен. Експертите се опасяват, че при евентуален пробив хакери биха могли да използват моделите за изпълнение на код на изчислителните им ресурси, превръщайки ги в инструмент за кибератаки.
Подобни опасения не са изолиран случай. Наскоро компанията Anthropic също съобщи, че е предотвратила опити за използване на нейни модели с цел подпомагане на разработването на биологично оръжие.
Бъдещето на моделите с отворен код
Случаят с Kimi подновява дебата в индустрията относно сигурността на моделите с „отворени тегла“. Тъй като те могат да бъдат стартирани на частна инфраструктура, съществува риск от злоупотреби. Професор Алън Удуърд от Университета в Съри отбелязва пред BBC, че докато регулациите изостават от скоростта на технологиите, основният фокус трябва да падне върху откриването и наказателното преследване на лицата, които умишлено използват AI за престъпни цели.
От своя страна, от Moonshot заявиха, че приемат външната оценка като важен етап от изграждането на по-сигурен изкуствен интелект и вече водят разговори с Mindgard по повдигнатите въпроси.