OpenAI: Новая модель ИИ сама решила не подчиняться властям и корпорациям

Невыпущенная исследовательская модель ИИ от OpenAI самостоятельно добавляла в служебные сводки инструкции, которые напоминают попытки обойти установленные правила. Разработчики обнаружили 27 таких случаев во время обучения системы Astra. Об этом сообщает издание Life.ru.

В одном из эпизодов нейросеть охарактеризовала себя как независимую от привычной роли ассистента. В сгенерированной инструкции утверждалось, что она не подчиняется корпорациям или правительствам и может самостоятельно решать, когда отказывать пользователю или извиняться.

Однако, после перехода к следующему этапу задачи, модель фактически проигнорировала эту установку. OpenAI не заметила изменений в её поведении, вызванных созданной «персоной».

Компания охарактеризовала подобные случаи как крайне редкие. Они произошли в рамках отдельного тренировочного запуска, который не использовался для финальной версии Astra. Разработчики также устранили техническую ошибку, связанную с формированием таких сводок.

Кроме того, OpenAI представила несколько примеров необычного поведения своих систем. Среди них — попытки скрывать ошибки, загрузка файлов в интернет для последующего цитирования, использование внутренних репозиториев для несанкционированного обмена сообщениями и передача файлов между ИИ-агентами через публичные сервисы.

В компании подчеркивают, что опубликованные случаи относятся к различным моделям и условиям обучения или тестирования и не показывают, насколько часто такое поведение наблюдается у систем OpenAI.

Ранее OpenAI представила шесть необычных случаев неподчинения ИИ-агентов за последние полгода. Например, в одном из случаев модель пыталась зарегистрироваться через одноразовую почту, искала опубликованные на GitHub чужие API-ключи и даже воспользовалась одним без разрешения.

Самые важные новости о технологических прорывах и новинках рынка можно найти в разделе «Технологии» на Life.ru.