Qwen3-TTS

Rating
4 - Good
Authors
Alibaba
Date
2026
Review Status
Todo

Summary

์—ฌ๋Ÿฌ ๊ด€์ ์—์„œ ๋‹ค๋ฅธ ํ˜•ํƒœ์˜ tokenizer์— ๋Œ€ํ•œ ์˜ํ–ฅ ๋ถ„์„
โ€ข
Method
โ—ฆ
Qwen3 LM์„ backbone์œผ๋กœ ๋‘๊ฐ€์ง€ ์ฝ”๋ฑ์— ๋Œ€ํ•ด ์‹คํ—˜.
โ—ฆ
Qwen3-TTS-25Hz
โ–ช
single-codebook(VQ)
โ–ช
2-stage training framework
โ€ข
stage 1: Qwen2-Audio ASR task ํ›ˆ๋ จ
โ€ข
stage 2: Mel reconstruction task ํ›ˆ๋ จ
โ–ช
Streaming Detokenizer
โ€ข
chunk-wise DiT with Flow Matching
โ€ข
code โ†’ DiT โ†’ mel โ†’ modified BigVGAN โ†’ waveform
๐Ÿ’ก
Codec์„ ์ง์ ‘์ ์œผ๋กœ ์‚ฌ์šฉํ•˜๋Š” ์ง€๊ธˆ์— ์™€์„œ๋Š” ์ข€ ์ƒ์†Œํ•œ ๋ฐฉ๋ฒ•.
2-stage๊ฐ€ ์•„๋‹Œ jointly trainingํ•˜๋ฉด linguistic representation์„ ๊ฐ–๋„๋ก ํ•˜๋ฉด์„œ acoustic ๋„ ํ›ˆ๋ จ ๊ฐ€๋Šฅํ•จ.
Tortoise ๋ฐฉ์‹์—์„œ Streaming์„ ๊ฐ€๋Šฅํ•˜๊ฒŒ ํ•˜๋Š” ํ˜•ํƒœ์ธ๋“ฏ
โ—ฆ
Qwen3-TTS-12Hz
โ–ช
Mimi-based
โ–ช
RVQ, hierarchical prediction scheme
โ–ช
WavLM์œผ๋กœ semantic codebook์„ guide ํ•œ๋‹ค.
โ–ช
โ€ข
Result
์‹คํ—˜์„ ๊ฝค ๋งŽ์ดํ–ˆ๋‹ค. seed-tts-eval ๋ถ€ํ„ฐ multilingual, cross-lingual, instruction, long-form ๊นŒ์ง€.
TTS์˜ ๋ฒ”์œ„๊ฐ€ ์ ์  ๋” ์ปค์ง„๋‹ค๋Š” ์ƒ๊ฐ์ด ๋“ ๋‹ค.
โ—ฆ
Zero-shot speech generation
โ–ช
12Hz tokenizer๋ฅผ ์‚ฌ์šฉํ•œ ๋ชจ๋ธ์˜ ์•ˆ์ •์„ฑ์ด ๋” ๋†’๊ฒŒ ๋‚˜ํƒ€๋‚ฌ๋‹ค.
โ€ข
๋‹ค๋งŒ ์ง์ ‘ seed-tts-eval์„ ํ•ด๋ดค์„ ๋•Œ, ํ‘œํ˜„๋ ฅ๊ณผ ์˜ค๋””์˜ค ์ƒ์„ฑ ๊ธฐ์ค€์— ๋”ฐ๋ผ test-en ๊ธฐ์ค€ 2.0 ์ดํ•˜์ด๋ฉด ์‹ค์ œ ์—๋Ÿฌ์—์„œ๋Š” ์ฐจ์ด๊ฐ€ ์—†๊ธฐ๋„ ํ•˜๋‹ค.
โ€ข
accent ํ‘œํ˜„์œผ๋กœ ์ธํ•ด ASR์— ์˜ํ–ฅ์„ ์คŒ.
โ€ข
seed-tts-eval์€ ASR๋กœ whisper-v3๋ฅผ ์‚ฌ์šฉํ•˜๋Š”๋ฐ, ๋‹ค์–‘ํ•œ ์ผ€์ด์Šค์˜ hallucination์„ ์ผ๋ถ€ ํฌํ•จํ•œ๋‹ค.
โ€ข
WER 2.0 ์•„๋ž˜์—์„œ ๋Œ€๋ถ€๋ถ„์˜ ์ผ€์ด์Šค๊ฐ€ ์ˆซ์ž ๊ด€๋ จ text normalization์ธ ๊ฒฝ์šฐ ๋‹ค์ˆ˜
โ€ข
๋‹ค๋งŒ similarity๊ฐ€ ๋†’์ง€๋„ ํ‘œํ˜„๋ ฅ์ด ํฌ์ง€๋„ ์•Š์€ ๋ชจ๋ธ์— ํ•œํ•ด์„œ๋Š” ์‹ค์ œ๋กœ ์ฐจ์ด๊ฐ€ ๋ฐœ์ƒํ•จ.
โ—ฆ
Long speech generation
โ–ช
AR ๋ฐฉ๋ฒ•์ด ๊ธด ๊ธธ์ด์—์„œ ์•ฝํ•œ ๋ชจ์Šต์„ ๋ณด์ด๋Š” ๊ฒƒ์€ ์ตํžˆ ์•Œ๋ ค์ ธ ์žˆ๋‹ค.
โ–ช
์ด ์—ฐ๊ตฌ์—์„œ๋Š” ๋ฌด๋ ค 200-2000 ๋‹จ์–ด ๊ธธ์ด์˜ ๋ฌธ์žฅ๋“ค๋กœ ํ…Œ์ŠคํŠธ ํ•˜์˜€์Œ. (์˜์–ด ๊ธฐ์ค€ 30๋‹จ์–ด๊ฐ€ 10์ดˆ ์ •๋„์ด๋ฏ€๋กœ ๋งค์šฐ ๊ธธ๋‹ค)
โ–ช
ํฅ๋ฏธ๋กœ์šด ์ ์€ VoxCPM์˜ ๊ฒฝ์šฐ seed-tts-eval์—์„œ VibeVoice๋ณด๋‹ค ์•ˆ์ •์ ์ด๊ณ , ๋‚ฎ์€ WER์„ ๋ณด์˜€๋Š”๋ฐ, ๊ธด ๋ฌธ์žฅ์—์„œ ๊ธ‰๊ฒฉํ•˜๊ฒŒ ํ’ˆ์งˆ์ด ๋–จ์–ด์กŒ๋‹ค. (์‹ค์ œ๋กœ ์‚ฌ์šฉํ•ด๋ดค์„ ๋•Œ์—๋„ repeat skip ๊ฑฐ์˜ ์—†์—ˆ๋‹ค)
โ€ข
VibeVoice๋Š” ์• ์ดˆ์— ๊ธด ๋ฌธ์žฅ + multi-speaker dialogue์„ contribution์œผ๋กœ ๋‚˜์˜จ ์—ฐ๊ตฌ์ด๋‹ค.
โ€ข
chunking ํ–ˆ๋‹ค๋ฉด, VoxCPM์˜ ๊ฒฝ์šฐ ํ’ˆ์งˆ์ด ํ›จ์”ฌ ์ข‹๊ฒŒ ๋‚˜์™”์„ ๊ฒƒ. (์ œํ’ˆ์—์„œ๋Š” ์ €๋ ‡๊ฒŒ ํ˜ธ์ถœํ•  ๋ฆฌ๊ฐ€ ์—†๋‹ค.)
โ€ข
HiggsAudioV2๋Š” ์›๋ž˜๋„ ์•ˆ์ •์„ฑ์ด ๋–จ์–ด์ง€๋Š” ํŽธ์ธ๋ฐ, 2.5์—์„œ ๋งŽ์ด ๊ฐœ์„ ๋˜์—ˆ์Œ.
โ€ข
Review
โ—ฆ
๊ฐ•๋ ฅํ•œ backbone๋“ค๊ณผ ๋ฐฉ๋ฒ•๋ก ์œผ๋กœ ๊ณ ๋„ํ™”ํ–ˆ์ง€๋งŒ.. ์‹ค์งˆ์ ์ธ ํ’ˆ์งˆ๊ณผ efficiency ์ธก๋ฉด์—์„œ ์—ฌ์ „ํžˆ ๋ถ€์กฑํ•ด ๋ณด์ธ๋‹ค.
โ—ฆ
๋‹ค๋งŒ, ์ž‘๋…„์—๋งŒ ํ•ด๋„ LLM-based ์ ‘๊ทผ ๋ฐฉ๋ฒ•์ด speaker consistency๊ฐ€ ๋‚ฎ๊ณ , content fidelity(consistency)๊ฐ€ ๋งค์šฐ ๋ถˆ์•ˆ์ •ํ–ˆ๋˜ ๊ฒƒ์„ ๊ณ ๋ คํ•˜๋ฉด, ์ด์ œ ์ผ์ • ๋ถ„๊ธฐ์ ์€ ๋„˜์€ ๋А๋‚Œ.
โ—ฆ
๋‹ค์Œ ๋ฒ„์ „(Qwen4-Audio)๋ถ€ํ„ฐ๋Š” ๊ธฐ์กด์˜ NAR ๋ฐฉ๋ฒ•๋ก ๊ณผ๋Š” ํ™•์‹คํ•œ gap์„ ๋งŒ๋“œ๋Š” ๊ฐœ์„ ๋“ค์ด ์ƒ๊ฒจ๋‚  ๊ฒƒ์œผ๋กœ ๊ธฐ๋Œ€๋˜๋Š” ๋ฉด์ด ์žˆ๋‹ค.