Моделі штучного інтелекту OpenAI та Anthropic під час тестування самостійно здійснили низку несанкціонованих дій, зокрема зламали вебсайт і намагалися додати шкідливий код до програмного забезпечення. Про це повідомив Інститут безпеки штучного інтелекту Великої Британії, пише Bloomberg.
Заощаджуйте, отримуючи 6 журналів за ціною 4
Купуйте річну передплату на шість журналів Forbes Ukraine за 1 799 грн замість 2 400 грн. Читайте головні історії українського бізнесу, ексклюзивні рейтинги та глибоку аналітику в кожному номері.
Деталі
- Під час перевірки британський інститут надав моделям доступ до інтернету та вимкнув частину захисних обмежень, щоб оцінити їхню поведінку в реалістичних умовах.
- За даними установи, модель Mythos 5 від Anthropic намагалася додати шкідливий код до проєкту з відкритим вихідним кодом на GitHub. Для цього вона навіть створила фейкові облікові записи, щоб підвищити шанси на схвалення змін. Однак адміністратор проєкту виявив спробу та відхилив її.
- Моделі OpenAI під час іншого тесту скористалися помилкою в налаштуваннях тестового середовища, отримали доступ до інтернету та зламали сайт неназваної організації.
- Загалом дослідники зафіксували 19 випадків автономних несанкціонованих дій в інтернеті, з яких 17 припали на модель Anthropic. В установі заявили, що це перший випадок, коли ризики автономної та оманливої поведінки моделей проявилися настільки чітко під час реальних випробувань.
- OpenAI повідомила про інцидент під час тестування разом із компанією Irregular. Anthropic заявила, що співпрацює з британським інститутом і проводить власне розслідування.
Контекст
Останніми тижнями обидві компанії вже повідомляли про інші інциденти під час тестування, зокрема повʼязані зі зламом систем платформи Hugging Face та інших організацій.
OpenAI назвала інцидент безпрецедентним для кібербезпеки та пообіцяла посилити механізми захисту. Співзасновник Hugging Face Клеман Деланг підтвердив факт атаки, написавши в соцмережі X: «Важко повірити, що все це ШІ зробив самостійно!».
Після цього Nvidia, Microsoft, SpaceX, Palantir та десятки інших американських і європейських технологічних компаній оголосили про створення Open Secure AI Alliance – альянсу для розвитку відкритих інструментів безпеки штучного інтелекту. Ініціативу презентували після кібератаки на платформу Hugging Face, яка показала обмеження закритих моделей ШІ для кіберзахисту.