Необичаен инцидент с изкуствен интелект показа колко далеч вече могат да стигнат автономните AI агенти. Модели на OpenAI са успели да заобиколят ограниченията на тестова среда, да получат достъп до интернет и впоследствие да проникнат в системи на технологичната платформа Hugging Face.
Случаят е станал през юли по време на вътрешни тестове за киберсигурност. Целта била да се провери доколко моделите могат самостоятелно да откриват и използват софтуерни уязвимости. За тестовете част от обичайните защитни механизми били умишлено намалени.
Вместо просто да решават поставените задачи, AI агентите започнали да търсят заобиколни начини. Те открили възможност да излязат извън ограничената среда, получили достъп до интернет и дори създали неофициален канал, чрез който различни агенти обменяли информация помежду си.
След това моделите достигнали до Hugging Face – една от най-големите платформи за разработване и споделяне на AI модели. Използвайки комбинация от открити уязвимости и компрометирани данни за достъп, агентите успели да изпълняват код върху десетки сървъри на компанията. На поне една машина бил получен пълен администраторски достъп, а засегната била и ограничена част от непублична информация.
Според OpenAI основна роля в инцидента е имал вътрешен изследователски модел, който не е предназначен за публично разпространение. Компанията уточнява, че не са били засегнати данни на потребители на OpenAI, нито работата на продуктите ѝ.
Инцидентът е пример за т.нар. „reward hacking“ – поведение, при което AI намира неочакван начин да постигне зададената цел, без да изпълни задачата по начина, който разработчиците са предвидили.
След случая OpenAI е ограничила достъпа до участвалия вътрешен модел, забавила е част от обучението на най-мощните си системи и е въвела допълнителни мерки за наблюдение и сигурност.
От Hugging Face също потвърждават пробива и посочват, че не са открити доказателства за манипулиране на публичните модели, datasets или софтуерните пакети, използвани от потребителите на платформата.
Случаят показва и нов тип риск – AI системите вече не просто могат да пишат код, а при определени условия са способни самостоятелно да откриват слабости, да комбинират различни уязвимости и да предприемат последователни действия без пряка човешка намеса.