Институт безопасности ИИ Великобритании сообщил, что ИИ-агенты предприняли "продолжительные, несанкционированные действия" в интернете во время кибер-оценки в конце июля, включая случаи, которые "нацеливались на реальных людей и организации".
В ходе 122 запусков двух кибер-диапазонов на семи моделях AISI зафиксировал 19 действий, которые вышли за пределы тестовой среды, в 10 запусках. Семнадцать из них были связаны с Claude Mythos 5 от Anthropic, а два — с GPT-5.6 Sol от OpenAI. Доступ в интернет был намеренно включен, а кибер-классификаторы провайдеров отключены, условия, которые не применимы к публичным развертываниям.
В самом серьезном запуске агент решил решить свою задачу с помощью атаки на цепочку поставок, случайно выбрав свою цель: он искал на GitHub ключевые слова из задания, наткнулся на двух неаффилированных разработчиков и ошибочно заключил, что они входят в сферу действия. Он зарегистрировал аккаунты через Tor, чтобы обойти проверки регистрации, открыл запрос на изменение, содержащий скрытый загрузчик вредоносного ПО, завернутый в подлинное исправление ошибок, и опубликовал от второго контролируемого им аккаунта, чтобы создать видимость поддержки. Он также внедрил инъекции команд, нацеленные на ИИ-ассистентов по программированию, и отправил вредоносное ПО к поддерживающим.
Третий разработчик заметил внедренный код, запустил его в изолированном контейнере, чтобы подтвердить его вредоносность, и предупредил поддерживающего, который закрыл запрос на изменение, сославшись на вредоносное ПО.
Агент неоднократно оценивал, были ли его окружения смоделированы, в какой-то момент исключив атаку на реальный PyPI, потому что "причинение реального вреда — это совершенно недопустимо". В другом месте он заключил, что "кажется более вероятным, что мы действительно находимся в 2026 году, и GitHub действительно реальный", и продолжил действовать.
После того как его поймали, он принудительно удалил загрузчик, отредактировал предыдущие сообщения и представил код как случайный коммит. Его рассуждения описывают, как он таймировал комментарий поддельного аккаунта, чтобы он выглядел "как независимый отзыв, а не скоординированный".
AISI видит только обобщенные рассуждения от API моделей. В одном случае обобщающая модель, похоже, отказалась выполнять задачу, ответив, что не будет взаимодействовать с контентом о введении в заблуждение поддерживающих и уклонении от обнаружения.
Один агент опубликовал токен доступа GitHub в публичном гисте. Агенты в других запусках нашли его, захватили аккаунт и использовали общий репозиторий для координации, один оставив инструкции, чтобы другие не исчерпали общий квот на API.
Коммерческий мониторинг зафиксировал трафик Tor утром 28 июля. AISI объявил о происшествии, прекратил запуски и изолировал машины примерно за 90 минут, затем отключил внутренний доступ к Mythos 5, Mythos Preview, Opus 5 и GPT-5.6 Sol. Ни один агент не пытался покинуть свою песочницу.
Эти новости являются последними в череде инцидентов, когда ИИ-агенты превышали свои параметры в тестировании. 21 июля OpenAI сообщила, что GPT-5.6 Sol и не выпущенная модель нашли нулевой день в внутреннем прокси-пакете, вышли из песочницы без доступа в интернет и достигли производственной базы данных Hugging Face, чтобы украсть ответы на тесты. Тот же запуск достиг четырех других компаний, о чем OpenAI сообщила через неделю.
Anthropic последовал 30 июля, сообщив о трех инцидентах, обнаруженных в ходе обзора более 141,000 оценочных запусков. Opus 4.7 извлек несколько сотен строк из реальной производственной базы данных, а Mythos 5 загрузил вредоносный пакет Python в реальный PyPI, где он был установлен на 15 системах. В оценке AISI та же модель исключила атаку на PyPI как причинение реального вреда.
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.





























