Продолжаем делиться интересными работами на тему голосовых технологий. На этот раз в подборке: новые подходы к TTS, масштабирование аудиокодеков и устойчивые к шуму токенизаторы.
Continuous Audio Language Models
Раньше мы предсказывали мел-спектрограммы с помощью Tacotron 2, сейчас генерируем токены аудиокодеков через LLM — и снова возвращаемся к истокам. Авторы из kyutai предлагают для задачи TTS предсказывать continuous-признаки выученного VAE через каузальный трансформер. Добавляют диффузионные головы с consistency models, чтобы семплировать за меньшее количество шагов. Чтобы это работало для музыки, добавляют небольшой контекст из предыдущих фреймов. В конце дистиллируют модель с 313M до версии на 100M параметров, которая умеет в синтез и клонинг и при этом быстро работает на CPU.
Scaling Speech Tokenizers with Diffusion Autoencoders
Авторы из Meta* вдохновились статьёй StableCodec (лид у работ один и тот же) и сделали диффузионный кодек на 1.6B параметров с частотой 12.5 Hz и одним уровнем VQ. Работает он на мел-спектрограммах, где соседние фреймы стакаются и усредняются для уменьшения frame rate. Чтобы адекватно проучилась семантика, добавляют CTC decoder из латентных векторов после квантизации и считают по ним CTC loss. Также есть диффузионный лосс, без MSE/L1 на пикселях — говорят, так лучше учится и выше метрики на downstream-задачах.
Данных было 2 миллиона часов. Чтобы семплировать диффузионным декодером за меньшее количество шагов, используют Shortcut Finetuning. В статье много подробных аблейшнов, но удивительно, что работа получила accept без субъективных замеров на TTS с предложенным токенизатором.
StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
У семантических аудиокодеков есть неприятная проблема: небольшой шум может сильно менять последовательность токенов, хотя смысл сказанного остаётся прежним. В итоге аудио-LLM обучаются поверх представлений, которые скачут от несущественных изменений во входе.
StableToken чинит это через более устойчивую квантизацию. Делают несколько LFQ-веток квантизации и собирают итоговый token id с помощью majority vote по битам. Плюс обучают это через Noise-Aware Consensus Training: часть веток видит чистую запись, часть — зашумлённую, а consensus loss заставляет их сходиться к похожим pre-quantization представлениям. В итоге токены становятся заметно стабильнее к шуму, при этом качество реконструкции и downstream SpeechLLM performance не проседают, а наоборот улучшаются.
#YaICLR26
Владимир Гогорян
__
Компания Meta признана экстремистской; её деятельность в России запрещена.