Scalable Keyword Spotting via Modular Network Expansion

Сегодня рассказываем о статье от команды технологий голосового ввода Яндекса. Работу приняли на конференцию Interspeech 2026, которая пройдёт с 27 сентября по 1 октября в Сиднее.

Авторы предложили новый способ обновлять набор голосовых команд в умных устройствах без забывания уже известных. Наш коллега Виктор Хаймоненко рассказал о методе подробнее.

Чтобы расширить набор команд, поддерживаемых устройством с голосовым управлением, нужно дообучить модель распознавания речи. Но есть проблема: часто такие модели забывают команды, которые уже знали, или начинают хуже понимать их. Это называют catastrophic forgetting.

Есть методы непрерывного обучения, например EWC (elastic weight consolidation), которые уменьшают эффект, но не устраняют его полностью. В работе предложили другой подход — модульное расширение модели. Он хорошо решает проблему и при этом требует меньше вычислительной мощности, чем те же LoRA и адаптеры.

Предлагается не менять всю работающую нейросеть, а просто добавлять к ней компактный модуль, отвечающий за распознавание новых команд. Эта ветка использует промежуточные признаки, которые извлекает основная модель, но имеет собственный классификатор для новых команд. При этом параметры базовой модели остаются неизменными, поэтому результаты её работы для старых команд не страдают.

Новый метод требует небольшого увеличения размера нейросети. Общее количество дополнительных параметров — не больше 10% от числа параметров изначальной модели.

Эффективность проверили на открытом датасете Google Speech Commands. В экспериментах модель должна была выучить новые пары команд и при этом продолжить поддерживать старые. Метод снизил среднюю долю пропущенных новых команд (FRR) с 6,46% до 4,37% по сравнению с отдельной моделью аналогичного размера и превзошёл методы адаптеров и LoRA.

Для сравнения, при обычном полном дообучении всей модели она хорошо усваивала новые команды, но гораздо хуже распознавала старые: средняя доля пропущенных известных команд выросла с 2,71% до 69,08%.

Об особенностях процесса обучения и том, как обходили ограничения, рассказали на Хабре.

ML Underhood