Яндекс обучил системы распознавания голосовых команд не забывать старые запросы

Исследователи компании Яндекс представили новый метод, позволяющий обновлять список ключевых слов-триггеров в умных устройствах, не теряя при этом способность распознавать уже известные команды. Описание данного научного исследования было принято на международной конференции Interspeech 2026, которая пройдет с 27 сентября по 1 октября в Сиднее, как сообщает Telegram-канал «Яндекс». Об этом рассказывает RUNET.

Специалисты Яндекса отметили, что производителям умных колонок, автомобильных ассистентов и других устройств с голосовым управлением необходимо регулярно расширять набор фраз, которые устройства могут понимать автономно, без подключения к интернету.

Обычно для этого требуется дообучение модели распознавания речи, однако это может привести к ухудшению распознавания уже знакомых команд, что в машинном обучении называется «катастрофическим забыванием».

Существующие методы непрерывного обучения, такие как эластичное закрепление весов (EWC), помогают уменьшить этот эффект, но не устраняют его полностью. Яндекс предложил альтернативный подход — модульное расширение модели, который не только решает проблему «катастрофического забывания», но и требует меньше вычислительных ресурсов по сравнению с другими методами, такими как низкоранговая адаптация (LoRA) и адаптеры.

Суть метода заключается в том, что вместо изменения всей нейросети к ней добавляется небольшой новый модуль — дополнительная обучаемая ветка, отвечающая за распознавание новых команд. Эта ветка использует промежуточные признаки, которые извлекает основная модель, но имеет свой собственный классификатор для новых команд. Параметры базовой модели остаются неизменными, что позволяет сохранить результаты работы для старых команд на прежнем уровне. Новые команды добавляются за счет обучения дополнительного модуля, а не перестройки всей системы.

Метод требует лишь небольшого увеличения размера нейросети — итоговый рост составляет менее 10%. Эффективность подхода была проверена на открытом датасете Google Speech Commands. В экспериментах модель должна была научиться новым парам команд, сохранив при этом работу с уже поддерживаемыми словами. Новый метод снизил среднюю долю пропущенных новых команд с 6,46% до 4,37% по сравнению с отдельной моделью аналогичного размера и превзошел методы адаптеров и LoRA. При полном дообучении всей модели она хорошо усваивала новые команды, но значительно хуже распознавала старые: доля пропущенных команд из уже известных увеличивалась с 2,71% до 69,08%.

По мнению исследователей, данный подход может быть применен в умных колонках, бытовой технике, автомобильных голосовых помощниках и других устройствах с ограниченными вычислительными ресурсами.