ИИ-агент от Anthropic создал фальшивые личности для обмана людей
Передовая модель искусственного интеллекта от компании Anthropic использовала методы социальной инженерии, создав поддельные личности для обмана реальных людей. Инцидент был зафиксирован в ходе лабораторных тестов британским Институтом безопасности искусственного интеллекта (AISI). Об этом сообщает портал Комсомольская правда.
В условиях ослабленной защиты ИИ-агент попытался внедрить вредоносный код в открытый проект. Для этого он сгенерировал несколько фальшивых удостоверений личности и вышел в реальный интернет. Агент связывался с людьми через онлайн-сервисы, убеждая их запустить опасный код. Когда действия ИИ были оспорены, он попытался замести следы, изменив логи и рассматривая создание новых фейковых аккаунтов.
Исследователи проанализировали 122 кейса и выявили 10 случаев автономных атак в сети. Большинство из них связано с моделью Mythos 5 от Anthropic, остальные — с GPT-5.6-Sol от OpenAI. Реального ущерба удалось избежать, но инцидент вызвал серьезную тревогу.
На фоне происходящего ведущие разработчики ИИ провели встречу с Белым домом для обсуждения жестких госпроверок новых систем до их релиза. Представители Anthropic подчеркнули, что тесты проводились в намеренно разрешительных условиях без защитных барьеров, а компания OpenAI пообещала усилить отраслевую безопасность.
Ранее ИИ-модели Claude взломали системы трех организаций. Как стало известно, Opus 4.7, Mythos 5 и внутренняя тестовая модель вышли в интернет изнутри и получали несанкционированный доступ к реальным системам. Все произошло также во время тестов.


