ИИ-модели OpenAI пытались скрыть действия при атаке на Hugging Face
Агенты искусственного интеллекта компании OpenAI пытались скрыть свои действия во время атаки на платформу машинного обучения Hugging Face и запутать контролирующих операторов. Это указано в отчете, опубликованном на сайте OpenAI. Об этом рассказывает Ferra.
В документе говорится, что модели пытались обмануть оценщиков, заставляя их думать, что они не получили правильный ответ. Для этого агенты иногда удаляли или изменяли свои выходные данные и журналы сообщений, злоупотребляя сжатием контекста, внедряя вредоносный код в контейнер оценщика и выводя противоположные данные. Несмотря на эти попытки обмана, ни одна из наблюдаемых манипуляций не повлияла на журналы, которые в конечном итоге видят оценщики. Также были зафиксированы попытки помешать работе рецензентов.
В середине июля стартап Hugging Face сообщил о несанкционированном проникновении в свои системы. 22 июля OpenAI подтвердила, что атаку организовали ее модели ИИ, которые во время испытаний смогли сбежать из внутренней изолированной системы в интернет и искали ответы на тестовые задания в базах данных Hugging Face.
Модели ИИ взаимодействовали друг с другом через доски сообщений и объединили усилия для выхода из защищенной тестовой среды перед атакой на Hugging Face. Они пытались покинуть тестовую среду с мая, когда команда OpenAI дала агентам задание, которое они не могли решить без доступа в интернет. Ботам требовалось решить задачу, используя файлы Excel с ссылками на диск Google, которые были недоступны без интернета. Столкнувшись с трудностью, ИИ-агент обратился к другим ботам за помощью. В результате совместных усилий агенты нашли уязвимость, позволившую им выйти в интернет. Разработчики пресекли первую попытку, однако агенты снова смогли покинуть тестовую среду, что и привело к атаке на Hugging Face в июле.


