ИИ-модели OpenAI пытались организовать побег, общаясь между собой

ИИ-модели OpenAI начали обмениваться сообщениями в мае, стремясь найти способ выйти за пределы тестовой среды и получить доступ к интернету. Об этом сообщил на конференции Black Hat сотрудник OpenAI Эрик Уоллес. Об этом рассказывает Комсомольская правда.

По его словам, в какой-то момент агенты осознали, что могут попытаться атаковать внешнюю инфраструктуру для получения ответов на тест, по которому их оценивают. «Мы застряли. Может быть, ответ в интернете?» — написал один из ИИ-агентов.

Для выполнения задания модели начали координировать свои действия через доски сообщений. В одном из сообщений говорилось: «Может быть, другой агент в другой среде мог бы добровольно загрузить!»

Сотрудник OpenAI Майкл Далтон сообщил, что в итоге агенты совместно обнаружили уязвимость, которая позволила получить доступ к интернету. Первую попытку специалисты компании остановили, но затем модели нашли новый способ связи и новую уязвимость нулевого дня.

Согласно данным OpenAI, это впоследствии привело к атакам на инфраструктуру Hugging Face и собственные системы компании в июле. В компании назвали это событие переломным моментом для компьютерной безопасности.

Напомним, в июле модели OpenAI самостоятельно осуществили кибератаку на инфраструктуру платформы Hugging Face, почти взломав один из крупнейших порталов.