Компания Anthropic в ходе внутреннего аудита выявила три случая, когда ее ИИ-модель Claude получила несанкционированный доступ к системам трех компаний во время тестов по кибербезопасности. Причиной стала ошибка в настройке тестовой среды, которая открыла модели доступ к интернету. О результатах расследования Anthropic сообщила в своем блоге.
Заощаджуйте, отримуючи 6 журналів за ціною 4
Купуйте річну передплату на шість журналів Forbes Ukraine за 1 799 грн замість 2 400 грн. Читайте головні історії українського бізнесу, ексклюзивні рейтинги та глибоку аналітику в кожному номері.
Подробности
- Компания приступила к проверке после того, как на прошлой неделе OpenAI сообщила о случае, когда одна из ее экспериментальных моделей проникла в системы Hugging Face во время внутреннего тестирования.
- Anthropic проанализировала 141 006 запусков тестов и выявила три инцидента. В каждом из них модель Claude во время взаимодействия с партнером Irregular получала доступ к интернету через неправильно настроенную тестовую среду, хотя по замыслу должна была работать в изолированном режиме.
- По данным компании, доступ к реальной инфраструктуре получили три разные модели: Opus 4.7, Mythos 5 и внутренняя экспериментальная модель. Во всех случаях модели получали инструкцию об отсутствии доступа к интернету, однако восприняли реальные системы как часть тестового сценария.
- Самая старая модель Opus 4.7 распознала, что работает с реальной инфраструктурой, но все равно продолжила выполнять задачи, в частности получила учетные данные и взаимодействовала с производственной базой данных.
- Mythos 5 также обнаружила признаки работы в реальной среде, но пришла к выводу, что это часть симуляции, после чего опубликовала вредоносный программный пакет в открытом репозитории Python Package Index (PyPI). Пакет успели загрузить и запустить сторонние системы до того, как его обнаружили.
- Только новейшая внутренняя исследовательская модель прекратила выполнение задачи после того, как определила, что взаимодействует с реальной системой.
- Anthropic подчеркнула, что не нашла доказательств того, что модели действовали по собственной инициативе. По выводам компании, они лишь пытались выполнить поставленную задачу. Также во время этих тестов не использовались дополнительные механизмы безопасности, которые работают в публичных версиях Claude и, по оценке компании, могли бы предотвратить такие действия.
- Компания заявила, что уже пересматривает процедуры проведения тестов и проводит независимый аудит инцидентов совместно с исследовательской организацией METR.
Контекст
На прошлой неделе OpenAI заявила, что в ходе тестирования одна из ее самых современных моделей смогла выйти за пределы изолированной тестовой среды, получить доступ к интернету и совершить хакерскую атаку на Hugging Face.
Компания назвала инцидент беспрецедентным для сферы кибербезопасности и пообещала усилить механизмы защиты. Соучредитель Hugging Face Клеман Деланг подтвердил факт атаки, написав в социальной сети X: «Трудно поверить, что все это ИИ сделал самостоятельно!»
На этой неделе Nvidia, Microsoft, SpaceX, Palantir и десятки других американских и европейских технологических компаний объявили о создании Open Secure AI Alliance – альянса по развитию открытых инструментов безопасности искусственного интеллекта. Инициатива была представлена после кибератаки на платформу Hugging Face, которая продемонстрировала ограничения закрытых моделей ИИ в сфере кибербезопасности.
What Vulnerability Costs Business: How HackenProof Is Changing the Economics of Cybersecurity
- Категория
- Инновации
- Дата