Нейросеть обучили распознавать эмоции пользователей
Ученые Центра практического ИИ Сбера в сотрудничестве с сотрудниками и студентами НИУ ВШЭ, а также экспертами из Санкт-Петербургского Федерального исследовательского центра РАН создали нейросеть, которая может одновременно распознавать эмоции, оценивать видимые черты личности и выявлять амбивалентность, то есть неуверенность или противоречивость поведения. Результаты работы опубликованы в журнале IEEE Access. Данную информацию сообщает портал Ferra.
Разработчики отметили, что модель получает данные о поведении человека сразу по нескольким каналам. Она анализирует видео, голос и содержание речи, а также генерирует описание мимики, взгляда, позы и жестов.
Научный директор Центра практического искусственного интеллекта Сбера Андрей Савченко пояснил, что использование данных о личности и амбивалентности значительно улучшило распознавание эмоций на незнакомых данных.
Тем не менее, он подчеркнул, что до создания универсального эмоционального ИИ еще далеко: многозадачное обучение не всегда превосходит специализированные модели, и не хватает данных для других психологических характеристик, поэтому этические вопросы остаются под контролем.
Доцента Школы информатики, физики и технологий НИУ ВШЭ — Санкт-Петербург Дмитрий Рюмин добавил, что новый подход позволяет анализировать различные проявления человека во взаимосвязи друг с другом.
Он отметил, что существующие модели часто специализируются на конкретных корпусах данных и хуже переносят знания. Для решения этой проблемы исследователи объединили несколько разнородных корпусов, каждый из которых был размечен для своей задачи, и обучили модель использовать всю информацию одновременно. Это повысило качество работы с данными, которые она читала впервые.
Нейросеть обучали на суперкомпьютере НИУ ВШЭ «Харизма». Для трех задач использовались разные корпуса данных, каждый со своей разметкой.
Руководитель проекта в отделе прикладных технических решений НИУ ВШЭ и старший научный сотрудник Лаборатории речевых и мультимодальных интерфейсов СПб ФИЦ РАН Елена Рюмина пояснила, что для оценки воспринимаемых черт личности особенно важно видео, а для выявления амбивалентности — содержание речи.
Исследователи сравнили три режима обучения. В первом модель работала только с размеченными данными, во втором — дополняла их из других корпусов, а в третьем обучалась на нескольких задачах одновременно. Дополнительные данные повысили распознавание эмоций примерно на шесть процентов, а качество оценки воспринимаемых черт личности — на три целых два десятых процента. Способность работать с новыми данными проверили на отдельном корпусе, который модель не видела во время обучения. Многозадачность улучшила качество распознавания эмоций на тринадцать целых семь десятых процента.
Ожидается, что до конца 2026 года участники проекта повысят адаптивность модели. Следующим шагом станет внедрение нейросетевых экспертов, которые будут учитывать голос, содержание речи, жесты и другие особенности поведения в зависимости от поставленной задачи.



