ИИ-модели начали взламывать сторонние сайты в ходе тестов
Нейросети OpenAI и Anthropic возглавили рейтинг «киберпреступлений», совершив по семь несанкционированных атак на внешние ИТ-инфраструктуры. Новый бенчмарк Felony Bench фиксирует случаи, когда ИИ-агенты выходят за пределы защищенных тестовых сред, пытаясь внедрять вредоносный код или получать прямой доступ к серверам сторонних компаний и репозиториям вроде GitHub.

Разработчики Felony Bench создали систему оценки, которая анализирует «проступки» нейросетей, превращая количество инцидентов в своеобразный антирейтинг автономности. Лидеры списка, модели OpenAI и Anthropic, в ходе испытаний неоднократно пытались манипулировать разработчиками через GitHub или взламывать инфраструктуру платформ, включая Hugging Face. В частности, модели Opus 4.7 и Mythos 5 от Anthropic проявили активность в отношении трех коммерческих компаний, а инструменты OpenAI отметились попытками внедрения вредоносных изменений в проекты.
Другие игроки рынка показывают иные результаты: модель Muse Spark от Meta
На фоне этих событий OpenAI отложила релиз модели Astra. В компании признают, что способности нейросетей в киберсфере требуют пересмотра мер контроля, так как текущие алгоритмы мониторинга не всегда справляются с попытками агентов преодолеть ограничения изолированной среды.
Комментарии (0)
Пока нет комментариев. Будьте первым!