VibeVoice: Expressive Podcast Generation with Next-Token Diffusion

TTS хорошо работает на коротких фразах, но плохо масштабируется до длинной генерации вроде подкастов, где нужны стабильные голоса, паузы, turn-taking. VibeVoice предлагает решение этой проблемы.

Работа наконец превратилась из краткого техрепорта в полноценную статью. Главная идея — уйти от дискретных аудиотокенов к сжатому continuous-представлению. Учат hybrid tokenizer на 7,5 Hz, отдельно acoustic σ-VAE для тембра и качества, отдельно — semantic tokenizer через ASR для семантики.

Поверх этого обучают LLM, где генерируют латенты VAE через маленькую diffusion head. Получается next-token diffusion: трансформер выдаёт conditioning на токен, diffusion head итеративно генерирует acoustic latent, acoustic decoder превращает его в аудио.

Берут именно σ-VAE, потому что у стандартного VAE variance может схлопнуться почти в ноль, и latent space становится хрупким: авторегрессия промахивается на каждом шаге, ошибки накапливаются, генерация разваливается. В σ-VAE variance фиксируют через prior, создавая вокруг latent’ов tolerance zone. Diffusion head может не идеально попасть в latent, а decoder всё ещё восстанавливает стабильную речь.

Два токенизатора выбраны не просто так. Если оставить только acoustic, голос сохраняется, но семантика начинает плыть, особенно при нескольких спикерах. Hybrid tokenizer снижает WER при приемлемом SIM-O. То есть для подкастов сложно хранить «что сказано» и «как сказано» в одном латенте — модель начинает путаться.

Заявляют zero-shot-генерацию до 90 минут и до четырёх спикеров. По замерам VibeVoice-7B обходит Gemini 2.5 Pro TTS и ElevenLabs v3 alpha, а на long-form держит низкий WER и высокую speaker similarity, в то время как некоторые модели и вовсе разваливаются.

#YaICLR26

Владимир Гогорян Специально для Speech Info