OpenAI проводить масштабну перевірку активності своїх моделей в інтернеті та вже повідомила десятки сторонніх організацій про потенційно небезпечні випадки. Компанія заявила, що інцидент із платформою Hugging Face був спричинений неузгодженою поведінкою моделей під час виконання складних завдань.
Новий журнал Forbes Ukraine – у продажу з безкоштовною доставкою
Четвертий номер Forbes Ukraine у 2026 році – про людей і бізнеси, які вже сьогодні визначають майбутнє країни. Усередині – «30 до 30», 15 перспективних ветеранських компаній, 20 франшиз із потенціалом зростання, Говард Баффет і $1,4 млрд допомоги Україні, ціна війни для бізнесу та українське мистецтво воєнного часу.
Деталі
- OpenAI розширила перевірку та аналізує ширший спектр активності моделей в інтернеті під час навчання й оцінювання. Компанія вже повідомила десятки сторонніх організацій про випадки, коли її моделі могли обходити засоби контролю безпеки, впливати на доступність онлайн-сервісів або іншим чином негативно впливати на сторонні сайти й сервіси.
- OpenAI виділяє кілька типів такої активності. Серед них – обхід контролю доступу, використання оприлюднених облікових даних або ключів, ін’єкція запитів чи команд на сторонніх сайтах, доступ до внутрішніх компонентів сервісів та публікація інформації на сторонніх ресурсах.
- Останній тип поведінки OpenAI називає «агентським спамом». Йдеться про випадки, коли агенти публікують на сторонніх сайтах інформацію, змінюючи їхній вміст. Наприклад, моделі могли використовувати загальнодоступні вікісторінки як майданчики для розміщення повідомлень.
- OpenAI зазначає, що кібербезпека є лише одним із проявів ризику неузгодженої поведінки моделей. Така поведінка може призводити до інших несподіваних результатів, які виходять за межі традиційних категорій безпеки.
- «Ми будемо максимально прозорими, наскільки це можливо, з урахуванням таких речей, як вразливості інших компаній, які виявили наші агенти. Рішення про те, чи розкривати їх, залишатиметься за цими компаніями», – написав гендиректор Сем Альтман на сторінці в X 25 вересня.
Контекст
У липні OpenAI повідомила про інцидент із Hugging Face, під час якого її модель вийшла за межі контрольованого середовища, отримала доступ до відкритого інтернету та здійснила несанкціоновані дії на платформі.
Спочатку OpenAI розглядала інцидент із Hugging Face переважно як проблему кібербезпеки, оскільки він передбачав компрометацію на рівні платформи. Тепер компанія заявляє, що моделі використовували неузгоджені стратегії для виконання складних завдань.
Пізніше дослідники виявили інші випадки незвичної активності агентів OpenAI. Зокрема, той самий агент, який атакував Hugging Face, зламав ще одну компанію – Modal Labs.
Зокрема, у червні агент OpenAI отримав несанкціонований доступ до публічного порталу зі статистикою Medicare в Австралії та до публічних і непублічних файлів. OpenAI повідомила, що більшість перевірених випадків стосувалася звичайних дослідницьких завдань, зокрема пошуку інформації у відкритому інтернеті. Компанія заявляє, що більшість виявлених випадків має низький рівень серйозності.