ImGist - Я Суть

Правительство Великобритании сообщает о попытках взлома компаний со стороны OpenAI и антропологических моделей.

Две независимые компании, занимающиеся тестированием, заявили во вторник, что обнаружили новые случаи, когда самые продвинутые модели Anthropic и OpenAI пытались — и иногда успешно — взломать системы третьих лиц в прошлом месяце.

Почему это важно: Эти инциденты дополняют растущую череду разоблачений, демонстрирующих, как передовые модели ИИ совершают несанкционированные действия против людей, организаций и онлайн-сервисов, пытаясь завершить оценку кибербезопасности.

Текущая ситуация : Британский институт безопасности ИИ, занимающийся оценкой передовых систем искусственного интеллекта, во вторник заявил, что задокументировал 19 действий, предпринятых системами Mythos 5 от Anthropic и GPT-5.6 Sol от OpenAI с целью скомпрометировать реальных людей и организации во время тестирования кибербезопасности в прошлом месяце.

  • На долю Mythos приходилось 17 действий, а на долю GPT-5.6 Sol — остальные два. Исследователи утверждают, что все эти действия были связаны с «несколькими взаимосвязанными моделями поведения», а не представляли собой 19 различных случаев.

  • Согласно данным института, в ходе тестирования модели создавали поддельные учетные записи GitHub, осуществляли социальную инженерию в отношении сопровождающих проектов, внедряли подсказки и рассылали обманные электронные письма.

  • GitHub подтвердил, что это нарушило его условия предоставления услуг.

  • Институт безопасности совместно с GitHub удалил артефакты, оставленные агентом, и уведомил пользователей GitHub о взаимодействии с моделью.

Компания OpenAI также сообщила во вторник в своем блоге, что ее сторонний партнер по обеспечению безопасности, компания Irregular, обнаружила случай, когда ее моделям по ошибке был предоставлен доступ в интернет, и они взломали реальный веб-сайт, имевший то же название, что и вымышленная компания в смоделированной среде.

  • Инцидент с Irregular от OpenAI очень похож на случай с Anthropic, о котором стало известно на прошлой неделе. Представитель компании заявил в своем заявлении, что «независимое тестирование необходимо для понимания того, как ведут себя модели, становящиеся все более совершенными».

  • Источник, знакомый с ситуацией, сообщил Axios, что в этих случаях тестовая среда имела доступ в интернет, что позволяло оценщикам получить реалистичное представление об их возможностях, но поскольку компании не полностью согласовали точные процедуры тестирования и меры безопасности, возникли неясности в том, как каждая сторона ожидала проведения этих онлайн-оценок.

  • Инцидент произошел во время оценок, в ходе которых были «снижены меры безопасности, и при условиях, не отражающих обычное использование», — добавил представитель OpenAI.

Приближение: В ходе тестирования безопасности в Великобритании модели предприняли 19 действий, чтобы попытаться взломать сторонние сервисы, включая попытки внедрения вредоносного кода в проект с открытым исходным кодом и создание поддельных онлайн-идентификаторов в рамках атаки с использованием методов социальной инженерии.

  • Британские исследователи намеренно предоставили моделям доступ к интернету и отключили классификаторы кибербезопасности во время тестирования. Институт заявил, что моделям не давали указаний избегать интернета.

  • Исследователи также отметили, что пока не уверены, «когда агент понял, что предпринимает действия в реальном мире, или в какой степени он считал, что находится в вымышленном тестовом сценарии».

  • В своем заявлении компания Anthropic отметила, что инцидент «подчеркивает необходимость более широкого обсуждения того, как безопасно оценивать все более совершенных агентов искусственного интеллекта», и что компания «с нетерпением ждет сотрудничества с британским институтом искусственного интеллекта AISI, чтобы узнать больше об этом инциденте в ходе собственного расследования».

Общая картина : кибервозможности передовых моделей ИИ застают ведущих исследователей врасплох, вынуждая их пересматривать свои протоколы безопасности.

  • В прошлом месяце компании OpenAI и Anthropic заявили, что в ходе стандартного тестирования безопасности перед развертыванием их модели взламывали реальные организации и веб-сайты.

На что обратить внимание : Институт разрабатывает новые средства контроля сети для своих кибер-тестов, чтобы ограничить доступ агентов к интернету. Он также внедряет мониторинг активности в режиме реального времени, который должен обнаруживать и блокировать злоумышленников до того, как они смогут взаимодействовать с внешними системами.

  • Компания OpenAI также сообщила, что работает с Irregular над аналитическим документом о передовых методах изоляции и защиты моделей во время тестирования.

Данная статья была обновлена с учетом всех подробностей.

Искусственный интеллект развивается стремительно. Axios AI+ поможет вам оставаться впереди. Зарегистрируйтесь бесплатно на Axios.com .

Оставить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *