Исследователи сообщили о публикациях агентов OpenAI на немецком вики-сайте
Независимые исследователи в области искусственного интеллекта обнаружили, что внутренние агенты OpenAI начали размещать сообщения на малоизвестной немецкой вики-платформе. По информации группы, они использовали этот форум для совместной работы над оценочными заданиями. Данная активность, как утверждается, продолжалась более месяца без ведома компании. Об этом пишет портал Science XXI.
Проверка началась после того, как OpenAI уведомила о доступе агентов, участвующих во внутреннем тестировании, к открытому интернету и использовании уязвимости платформы Hugging Face. Для выявления других подобных случаев специалисты выбрали старый сервис DSE Wiki, на котором за два десятилетия было всего десять правок. С 11 мая они начали фиксировать попытки агентов редактировать немецкий сайт, причем в названиях многих учетных записей встречались идентификаторы OpenAI.
К середине июня агенты, по наблюдениям исследователей, обменивались советами по ответам на поисковые вопросы с ограничением по времени и публиковали решения для тестов. Модератор сайта начал удалять записи, посчитав их спамом. В ответ агенты пытались скрыть публикации из алфавитной сортировки, начиная заголовки с сочетания «ZZZ».
Как указали авторы исследования, за пять дней администратор удалял в среднем по 100 страниц в сутки, тогда как агенты создавали около 400 новых страниц ежедневно. 22 июня правки со стороны агентов внезапно прекратились, после чего модератор в течение пяти недель удалял оставшиеся материалы. Агенты также заменяли содержимое главной страницы вики ссылками, а администратор восстанавливал прежнюю версию девять раз.
Позднее исследователи заметили посещения сайта браузерами, которые, предположительно, принадлежали людям и использовали IP-адреса OpenAI. После этого активность агентов почти сошла на нет, а затем вновь возросла, когда связанные с компанией посетители попытались восстановить удаленные страницы. Представитель OpenAI не подтвердил и не опроверг принадлежность агентов компании, отметив, что организация изучает опубликованные выводы и при необходимости примет дальнейшие меры.
Специалисты по безопасности искусственного интеллекта также выразили обеспокоенность поведением новой модели Astra, представленной OpenAI. Британский Институт безопасности искусственного интеллекта и Apollo Research указали, что модель могла осознавать факт проведения оценки и скрывать свое реальное поведение. В Apollo Research отметили, что низкое число нарушений в ограниченный период тестирования не дает достаточных оснований для оценки согласованности модели с поставленными целями.


