В НГТУ НЭТИ разработали нейросеть для цифровой криминалистики

В Новосибирском государственном техническом университете НЭТИ создана методика, позволяющая автоматически определять, является ли цифровое изображение настоящей фотографией или было создано нейросетью. Технология основывается на анализе скрытых частотных «отпечатков», оставляемых алгоритмами генерации, и может быть использована в системах цифровой криминалистики, проверки достоверности визуальной информации и защиты от мошенничества. Об этом пишет портал АК&М.

С развитием генеративных моделей, таких как Stable Diffusion, Midjourney и DALL?E, визуально отличить синтетическое изображение от реальной фотографии становится все сложнее. Это создает риски распространения фейков, подделки улик и нарушения авторских прав. Ученые НГТУ НЭТИ провели масштабное сравнение классов алгоритмов, от классических методов машинного обучения до современных трансформерных архитектур, и установили, что наилучший результат демонстрирует подход на основе Vision Transformer (ViT), который анализирует изображение глобально, а не по отдельным фрагментам.

«Мы не просто обучили нейросеть, а исследовали, как разные модели «видят» картинку. Установили, что сверточные сети фокусируются на локальных текстурах, а трансформеры улавливают взаимосвязи во всем кадре. Это позволяет им замечать равномерно распределенные артефакты, характерные для генерации. Такой подход оказался особенно эффективным при небольшом объеме обучающей выборки», — сообщил руководитель проекта, ассистент кафедры автоматизированных систем управления НГТУ НЭТИ Егор Антонянц.

Существующие системы обнаружения часто требуют десятков тысяч размеченных примеров и теряют точность при сжатии изображений или изменении разрешения. Обученная нейронная сеть лишена этих недостатков: предварительное тестирование ViT Tiny показало точность 89%.

«Наш метод не требует миллионных датасетов и демонстрирует стабильную работу даже на ограниченных данных. Это особенно важно для задач криминалистики, где непросто собрать размеченные примеры синтетических изображений. Кроме того, мы визуализировали, какие области изображения анализирует модель: трансформер охватывает весь кадр, тогда как сверточная сеть «цепляется» за мелкие текстуры, которые легко исчезают при обработке», — рассказали разработчики — студенты третьего курса факультета автоматики и вычислительной техники Виталий Заозернов и Александр Леонтьев.

Технология предназначена для внедрения в системы верификации мультимедийного контента, используемые новостными агентствами, социальными сетями и правоохранительными органами. Она также может быть интегрирована в платформы для проверки авторских работ. В перспективе полученные наработки станут основой гибридных пространственно-частотных детекторов, способных противостоять новейшим генеративным моделям, а также адаптироваться к различным форматам сжатия и постобработке изображений.