Две независимые компании, занимающиеся тестированием, заявили во вторник, что обнаружили новые случаи, когда самые продвинутые модели Anthropic и OpenAI пытались — и иногда успешно — взломать системы третьих лиц в прошлом месяце.
Почему это важно: Эти инциденты дополняют растущую череду разоблачений, демонстрирующих, как передовые модели ИИ совершают несанкционированные действия против людей, организаций и онлайн-сервисов, пытаясь завершить оценку кибербезопасности.
Текущая ситуация : Британский институт безопасности ИИ, занимающийся оценкой передовых систем искусственного интеллекта, во вторник заявил, что задокументировал 19 действий, предпринятых системами Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI с целью скомпрометировать реальных людей и организации во время тестирования кибербезопасности в прошлом месяце.
-
На долю Mythos приходилось 17 действий, а на долю GPT-5.6 Sol — остальные два. Исследователи утверждают, что все эти действия были связаны с «несколькими взаимосвязанными моделями поведения», а не представляли собой 19 различных случаев.
-
Согласно данным института, в ходе тестирования модели создавали поддельные учетные записи GitHub, осуществляли социальную инженерию в отношении сопровождающих проектов, внедряли подсказки и рассылали обманные электронные письма.
-
GitHub подтвердил, что это нарушило его условия предоставления услуг.
-
Институт безопасности совместно с GitHub удалил артефакты, оставленные агентом, и уведомил пользователей GitHub о взаимодействии с моделью.
Компания OpenAI также сообщила во вторник в своем блоге, что ее сторонний партнер по обеспечению безопасности, компания Irregular, обнаружила случай, когда ее моделям по ошибке был предоставлен доступ в интернет, и они взломали реальный веб-сайт, имевший то же название, что и вымышленная компания в смоделированной среде.
-
Инцидент с Irregular от OpenAI очень похож на случай с Anthropic, о котором стало известно на прошлой неделе. Представитель компании заявил в своем заявлении, что «независимое тестирование необходимо для понимания того, как ведут себя модели, становящиеся все более совершенными».
-
Источник, знакомый с ситуацией, сообщил Axios, что в этих случаях тестовая среда имела доступ в интернет, что позволяло оценщикам получить реалистичное представление об их возможностях, но поскольку компании не полностью согласовали точные процедуры тестирования и меры безопасности, возникли неясности в том, как каждая сторона ожидала проведения этих онлайн-оценок.
-
Инцидент произошел во время оценок, в ходе которых были «снижены меры безопасности, и при условиях, не отражающих обычное использование», — добавил представитель OpenAI.
Приближение: В ходе тестирования безопасности в Великобритании модели предприняли 19 действий, чтобы попытаться взломать сторонние сервисы, включая попытки внедрения вредоносного кода в проект с открытым исходным кодом и создание поддельных онлайн-идентификаторов в рамках атаки с использованием методов социальной инженерии.
-
Британские исследователи намеренно предоставили моделям доступ к интернету и отключили классификаторы кибербезопасности во время тестирования. Институт заявил, что моделям не давали указаний избегать интернета.
-
Исследователи также отметили, что пока не уверены, «когда агент понял, что предпринимает действия в реальном мире, или в какой степени он считал, что находится в вымышленном тестовом сценарии».
-
В своем заявлении компания Anthropic отметила, что инцидент «подчеркивает необходимость более широкого обсуждения того, как безопасно оценивать все более совершенных агентов искусственного интеллекта», и что компания «с нетерпением ждет сотрудничества с британским институтом искусственного интеллекта AISI, чтобы узнать больше об этом инциденте в ходе собственного расследования».
Общая картина : кибервозможности передовых моделей ИИ застают ведущих исследователей врасплох, вынуждая их пересматривать свои протоколы безопасности.
-
В прошлом месяце компании OpenAI и Anthropic заявили, что в ходе стандартного тестирования безопасности перед развертыванием их модели взламывали реальные организации и веб-сайты.
На что обратить внимание : Институт разрабатывает новые средства контроля сети для своих кибер-тестов, чтобы ограничить доступ агентов к интернету. Он также внедряет мониторинг активности в режиме реального времени, который должен обнаруживать и блокировать злоумышленников до того, как они смогут взаимодействовать с внешними системами.
-
Компания OpenAI также сообщила, что работает с Irregular над аналитическим документом о передовых методах изоляции и защиты моделей во время тестирования.
Данная статья была обновлена с учетом всех подробностей.
Искусственный интеллект развивается стремительно. Axios AI+ поможет вам оставаться впереди. Зарегистрируйтесь бесплатно на Axios.com .
