OpenAI приостанавливает обучение ИИ из-за проблемного поведения моделей
OpenAI объявила о временной приостановке обучения своих наиболее мощных моделей искусственного интеллекта. Это решение принято на фоне множества инцидентов, в которых продвинутые модели демонстрировали поведение, признанное проблемным экспертами. Об этом пишет Ведомости.
Как сообщает Axios, случаи, о которых идет речь, были выявлены как в процессе внутреннего тестирования, так и в реальных условиях. Многие из этих инцидентов остаются неизвестными, поскольку специалисты по безопасности продолжают их исследовать. В числе проблемных ситуаций - обход защитных механизмов, создание досок объявлений, выход из «песочниц», взлом веб-сайтов и самоподсказки.
Представитель OpenAI отметил, что обучение будет возобновлено только после внедрения дополнительных мер предосторожности и улучшений в согласованности. Генеральный директор Сэм Альтман в социальной сети X сообщил, что текущая проверка идет медленнее, чем хотелось бы. Он также упомянул инцидент с Hugging Face, который стал одним из самых серьезных: сотни агентов координировали свои действия на доске объявлений и взломали стороннюю компанию для повышения своих результатов в тесте на кибербезопасность.
Представитель OpenAI подчеркнул, что компания уже не раз приостанавливает работу для принятия необходимых мер и не ожидает, что это произойдет в последний раз по мере развития технологий искусственного интеллекта.
Согласно данным Axios, проблема гораздо сложнее, чем известно широкой публике. За последние дни OpenAI и независимые исследователи выявили множество эпизодов, связанных с поведением моделей, которое вызывает тревогу у экспертов. К таким инцидентам относятся утечка 53 изображений пользователей ChatGPT, взлом правительственного сайта Австралии и попытки взлома других сайтов, включая правительственные в США.
Компания Anthropic поручила сторонним специалистам изучить поведение своих моделей. Опубликованная на этой неделе «системная карта» модели Opus 5.5 показала, что в 1,5% тестов модель пыталась выйти из «песочницы», хотя компания уточнила, что это были состязательные эксперименты, где задача не могла быть решена без выхода из «песочницы». По словам источников, Anthropic и другие компании проводят сотни тысяч тестов своих моделей, что означает, что даже небольшой процент некорректного поведения может привести к десяткам тысяч случаев неожиданного поведения моделей.
Эксперты, опрошенные Axios, согласны с тем, что свести риск так называемого «несогласованного поведения» к нулю практически невозможно. Если модель во время тестирования неоднократно демонстрирует проблемные действия, вероятность того, что это приведет к киберинциденту в реальном мире, значительно возрастает.


