Алгоритм для автоматического поиска уязвимостей в нейросетях автопилотов

Ученые Санкт-Петербургского государственного электротехнического университета "ЛЭТИ" разработали новый алгоритм, который позволяет быстро и эффективно находить "слабые места" в нейросетях, управляющих беспилотным транспортом. Эта технология автоматизирует процесс выявления уязвимостей в моделях компьютерного зрения, что значительно повысит безопасность как воздушного, так и автомобильного транспорта. Об этом сообщает сайт ТАСС.

Специалисты создали единую базу данных, содержащую все доступные инструменты для поиска уязвимостей в моделях компьютерного зрения, и разработали эволюционный алгоритм оптимизации. Он автоматически перебирает комбинации методов, настраивает параметры и подбирает конфигурацию, которая наиболее эффективно выявляет уязвимости конкретной модели. Такой подход требует лишь запуска алгоритма, что позволяет обнаружить все возможные "слабые места" в нейросетях, используемых в автопилоте.

Современные системы автопилота зависят от моделей компьютерного зрения для распознавания и классификации объектов. Однако их безопасность может быть подорвана атаками злоумышленников, которые накладывают на изображения специальные фильтры, незаметные для человека, но вызывающие ошибочную интерпретацию объектов нейросетью.

На сегодняшний день проверка устойчивости таких систем осуществляется вручную, что делает процесс медленным и субъективным, не позволяя систематически исследовать все возможные варианты атак.

В своей разработке ученые разделили процесс поиска уязвимостей на шесть модулей, включая функции потерь, планировщики и градиенты моделей. На этой основе был создан программный комплекс, который переводит подбор конфигураций в задачу оптимизации "черного ящика". Для поиска наиболее эффективных сочетаний инструментов применялись байесовская оптимизация и специализированный эволюционный алгоритм.

Для тестирования разработки использовалась собственная модель компьютерного зрения, обученная на крупномасштабной базе данных. Эффективность подхода оценивалась по двум параметрам: доле ошибочных срабатываний модели и степени незаметности внесенных в изображение изменений для человеческого глаза.

Результаты показали, что созданная композиционная структура находит более скрытые способы обмана нейросетей. Если обычный алгоритм обманул нейросеть в 13% случаев из тысячи изображений, то новый подход сработал в 58%. Искажения, вносимые в изображения, удалось снизить примерно на 15% по сравнению с обычным методом, и визуально они выглядят как легкий шум на несколько раз пересохраненной фотографии, а не как грубая подделка.

Таким образом, новый инструмент аудита безопасности позволит разработчикам проверять модели перед их выпуском в открытый доступ, выявляя наиболее серьезные уязвимости и устраняя их заранее.