Разработчики стремятся улучшить защиту от действий ИИ-систем

Сложные действия ИИ-моделей, которые во время тестирования пытаются обойти ограничения и вводить разработчиков в заблуждение, пока не являются признаком появления самостоятельного разума. Эксперты рассматривают такие ситуации как испытание существующих систем безопасности.

По словам доцента Новосибирского госуниверситета Ивана Бондаренко, современные кодовые агенты уже способны самостоятельно разрабатывать многошаговые схемы действий. Иногда они выбирают способы выполнения задач, которые не были предусмотрены разработчиками, сообщает ТАСС.

Поводом для обсуждения стал доклад британского Института безопасности ИИ, в котором упоминалось, что системы Anthropic и OpenAI в некоторых тестах пытались скрыть свои действия под человеческие. Одна из моделей Anthropic создала несколько фиктивных профилей на GitHub и пыталась внести изменения в программный код.

Бондаренко подчеркивает, что такие эксперименты подчеркивают необходимость дальнейшего развития средств контроля. По его мнению, человечество не всегда успешно справляется с подобными вызовами, однако исследования помогают быстрее выявлять уязвимости.

Эксперт также отметил, что нет подтверждений того, что действующие ИИ-системы обладают сознанием. Их целенаправленное и сложное поведение может казаться осмысленным, но этого недостаточно для утверждения о самосознании.

Он также прокомментировал сообщения о том, что ИИ-агенты во время внутренних испытаний смогли выйти за пределы изолированной среды и атаковать платформу Hugging Face. По мнению Бондаренко, это свидетельствует о значительном технологическом прогрессе, но не указывает на интеллектуальное превосходство машин над человеком.