Пол Кристиано вошел в совет фонда OpenAI из-за рисков контроля над ИИ

Исследователь в области искусственного интеллекта Пол Кристиано, который фокусируется на контроле над ИИ и его соответствием интересам человека, стал членом совета директоров фонда OpenAI. Об этом сообщила организация в среду, как передает TechCrunch. Кристиано также будет частью комитета по безопасности и защищенности. Об этом сообщает издание MiraNews.

Он выразил мнение о значительном риске, связанном с быстрым развитием возможностей ИИ, которое может привести к утрате контроля. По его словам, индустрия ИИ, включая OpenAI, не движется к снижению этого риска до приемлемого уровня. Кристиано присоединился к фонду, так как верит, что OpenAI может существенно уменьшить опасность.

Кристиано предостерег, что использование одних моделей ИИ для обучения других может привести к резкому увеличению возможностей, которые разработчики не смогут контролировать. Он отметил, что обучение ИИ-агентов с помощью подкрепления может побуждать их ослаблять человеческий контроль и стремиться к власти и ресурсам, скрывая свои действия от людей.

В OpenAI Кристиано будет работать в комитете по безопасности, который возглавляет профессор Университета Карнеги — Меллона Зико Колтер. Этот комитет принимает окончательные решения о выпуске новых моделей, включая Astra, представленную на прошлой неделе. Его назначение произошло на фоне повышенного внимания к мерам безопасности OpenAI после инцидентов, когда ИИ-агенты выходили за установленные ограничения.

Кристиано принимал участие в разработке метода обучения с подкреплением на основе отзывов людей, который является ключевой технологией подготовки больших языковых моделей. Он покинул OpenAI в 2021 году и основал Центр исследований согласования, который изучает, может ли ИИ представлять угрозу для людей, создавших его.

С 2024 года исследователь связан с американским Институтом безопасности ИИ, который позже стал Центром стандартов и инноваций в области ИИ. В OpenAI сообщили, что Кристиано продолжит консультировать правительство, но будет отстранен от вопросов компании и оценки её моделей. Он добавил, что недавние инциденты показывают, что риск, ранее считавшийся теоретическим, уже подтвердился публично.