В НГТУ НЭТИ разработали нейросеть для цифровой криминалистики
В Новосибирском государственном техническом университете НЭТИ создана методика, позволяющая автоматически определять, является ли цифровое изображение настоящей фотографией или было создано нейросетью. Технология основывается на анализе скрытых частотных «отпечатков», оставляемых алгоритмами генерации, и может быть использована в системах цифровой криминалистики, проверки достоверности визуальной информации и защиты от мошенничества. Об этом пишет портал АК&М.
С развитием генеративных моделей, таких как Stable Diffusion, Midjourney и DALL?E, визуально отличить синтетическое изображение от реальной фотографии становится все сложнее. Это создает риски распространения фейков, подделки улик и нарушения авторских прав. Ученые НГТУ НЭТИ провели масштабное сравнение классов алгоритмов, от классических методов машинного обучения до современных трансформерных архитектур, и установили, что наилучший результат демонстрирует подход на основе Vision Transformer (ViT), который анализирует изображение глобально, а не по отдельным фрагментам.
«Мы не просто обучили нейросеть, а исследовали, как разные модели «видят» картинку. Установили, что сверточные сети фокусируются на локальных текстурах, а трансформеры улавливают взаимосвязи во всем кадре. Это позволяет им замечать равномерно распределенные артефакты, характерные для генерации. Такой подход оказался особенно эффективным при небольшом объеме обучающей выборки», — сообщил руководитель проекта, ассистент кафедры автоматизированных систем управления НГТУ НЭТИ Егор Антонянц.
Существующие системы обнаружения часто требуют десятков тысяч размеченных примеров и теряют точность при сжатии изображений или изменении разрешения. Обученная нейронная сеть лишена этих недостатков: предварительное тестирование ViT Tiny показало точность 89%.
«Наш метод не требует миллионных датасетов и демонстрирует стабильную работу даже на ограниченных данных. Это особенно важно для задач криминалистики, где непросто собрать размеченные примеры синтетических изображений. Кроме того, мы визуализировали, какие области изображения анализирует модель: трансформер охватывает весь кадр, тогда как сверточная сеть «цепляется» за мелкие текстуры, которые легко исчезают при обработке», — рассказали разработчики — студенты третьего курса факультета автоматики и вычислительной техники Виталий Заозернов и Александр Леонтьев.
Технология предназначена для внедрения в системы верификации мультимедийного контента, используемые новостными агентствами, социальными сетями и правоохранительными органами. Она также может быть интегрирована в платформы для проверки авторских работ. В перспективе полученные наработки станут основой гибридных пространственно-частотных детекторов, способных противостоять новейшим генеративным моделям, а также адаптироваться к различным форматам сжатия и постобработке изображений.


