Недостаток кейсов снижает эффективность обучения нейросетей от мошенников
Недостаток реальных примеров мошенничества снижает эффективность обучения нейросетей, которые должны защищать от мошенников. Это мнение высказали специалисты Московского политехнического университета в результате исследования, посвященного эффективности соответствующих моделей и алгоритмов. Об этом сообщает ТАСС.
По информации Банка России, в прошлом году мошенники похитили у граждан 29,3 миллиарда рублей, что на 6,4% больше, чем в предыдущем году. При этом банки смогли вернуть клиентам менее 6% от похищенного. Исследователи Московского политеха выяснили, что одна из причин, по которой системы на основе искусственного интеллекта пропускают такие операции, заключается не в слабости алгоритмов, а в нехватке реальных данных о мошенничестве для обучения.
Профессор кафедры "Инфокогнитивные технологии" Александр Гаврилов пояснил, что нейросети, предназначенные для защиты от мошенников, в определенной степени "облегчают себе жизнь" благодаря благоприятной общей статистике. Большинство банковских операций являются легитимными, и доля мошеннических составляет лишь тысячные доли процента от общего объема платежей. Нейросеть, обученная на таких данных, видит миллионы нормальных транзакций и лишь несколько случаев мошенничества. Это приводит к тому, что модель начинает чаще определять операции как легитимные, что, в свою очередь, ведет к пропуску мошеннических действий.
Исследовательская группа Московского политеха изучила, как разработчики "антифрод-систем" компенсируют этот перекос. Например, метод SMOTE добавляет синтетические примеры мошеннических операций в обучающую выборку, не используя данные реальных людей. Генеративно-состязательные сети создают правдоподобные воображаемые случаи мошенничества, расширяя слишком малый набор реальных примеров. Другой подход включает взвешивание классов, при котором модель получает больший штраф за пропущенного мошенника, что заставляет ее более внимательно проверять подозрительные операции.
Графовые нейронные сети анализируют связи между счетами, клиентами и операциями как единую сеть, что позволяет находить целые группы мошенников, действующих синхронно. Системы "обучения с подкреплением" получают обратную связь по каждому решению и адаптируют стратегию проверки под новые схемы обмана. Распределенные системы для анализа транзакций в реальном времени способны обрабатывать тысячи операций в секунду, что критично для крупных банков и платежных сервисов.
Современные модели машинного обучения достигают точности от 88 до 94% на реальных задачах, а лучшие результаты показывают их комбинации, такие как ансамбли нескольких моделей с предварительной балансировкой данных.
Однако у всех этих решений есть общие ограничения. Банки не могут открыто делиться данными о реальных случаях мошенничества из-за конфиденциальности клиентов, что мешает независимым разработчикам сравнивать свои модели. Сложные нейросети плохо объясняют, почему они считают операцию подозрительной, что затрудняет проверку их решений регуляторами и службами безопасности банков. Кроме того, мошенники быстро меняют схемы обмана, и модель, обученная на устаревших данных, теряет точность со временем.


