Summary
์ฌ๋ฌ ๊ด์ ์์ ๋ค๋ฅธ ํํ์ tokenizer์ ๋ํ ์ํฅ ๋ถ์
โข
Method
โฆ
Qwen3 LM์ backbone์ผ๋ก ๋๊ฐ์ง ์ฝ๋ฑ์ ๋ํด ์คํ.
โฆ
Qwen3-TTS-25Hz
โช
single-codebook(VQ)
โช
2-stage training framework
โข
stage 1: Qwen2-Audio ASR task ํ๋ จ
โข
stage 2: Mel reconstruction task ํ๋ จ
โช
Streaming Detokenizer
โข
chunk-wise DiT with Flow Matching
โข
code โ DiT โ mel โ modified BigVGAN โ waveform
Codec์ ์ง์ ์ ์ผ๋ก ์ฌ์ฉํ๋ ์ง๊ธ์ ์์๋ ์ข ์์ํ ๋ฐฉ๋ฒ.
2-stage๊ฐ ์๋ jointly trainingํ๋ฉด linguistic representation์ ๊ฐ๋๋ก ํ๋ฉด์ acoustic ๋ ํ๋ จ ๊ฐ๋ฅํจ.
Tortoise ๋ฐฉ์์์ Streaming์ ๊ฐ๋ฅํ๊ฒ ํ๋ ํํ์ธ๋ฏ
โฆ
Qwen3-TTS-12Hz
โช
Mimi-based
โช
RVQ, hierarchical prediction scheme
โช
WavLM์ผ๋ก semantic codebook์ guide ํ๋ค.
โช
โข
Result
์คํ์ ๊ฝค ๋ง์ดํ๋ค. seed-tts-eval ๋ถํฐ multilingual, cross-lingual, instruction, long-form ๊น์ง.
TTS์ ๋ฒ์๊ฐ ์ ์ ๋ ์ปค์ง๋ค๋ ์๊ฐ์ด ๋ ๋ค.
โฆ
Zero-shot speech generation
โช
12Hz tokenizer๋ฅผ ์ฌ์ฉํ ๋ชจ๋ธ์ ์์ ์ฑ์ด ๋ ๋๊ฒ ๋ํ๋ฌ๋ค.
โข
๋ค๋ง ์ง์ seed-tts-eval์ ํด๋ดค์ ๋, ํํ๋ ฅ๊ณผ ์ค๋์ค ์์ฑ ๊ธฐ์ค์ ๋ฐ๋ผ test-en ๊ธฐ์ค 2.0 ์ดํ์ด๋ฉด ์ค์ ์๋ฌ์์๋ ์ฐจ์ด๊ฐ ์๊ธฐ๋ ํ๋ค.
โข
accent ํํ์ผ๋ก ์ธํด ASR์ ์ํฅ์ ์ค.
โข
seed-tts-eval์ ASR๋ก whisper-v3๋ฅผ ์ฌ์ฉํ๋๋ฐ, ๋ค์ํ ์ผ์ด์ค์ hallucination์ ์ผ๋ถ ํฌํจํ๋ค.
โข
WER 2.0 ์๋์์ ๋๋ถ๋ถ์ ์ผ์ด์ค๊ฐ ์ซ์ ๊ด๋ จ text normalization์ธ ๊ฒฝ์ฐ ๋ค์
โข
๋ค๋ง similarity๊ฐ ๋์ง๋ ํํ๋ ฅ์ด ํฌ์ง๋ ์์ ๋ชจ๋ธ์ ํํด์๋ ์ค์ ๋ก ์ฐจ์ด๊ฐ ๋ฐ์ํจ.
โฆ
Long speech generation
โช
AR ๋ฐฉ๋ฒ์ด ๊ธด ๊ธธ์ด์์ ์ฝํ ๋ชจ์ต์ ๋ณด์ด๋ ๊ฒ์ ์ตํ ์๋ ค์ ธ ์๋ค.
โช
์ด ์ฐ๊ตฌ์์๋ ๋ฌด๋ ค 200-2000 ๋จ์ด ๊ธธ์ด์ ๋ฌธ์ฅ๋ค๋ก ํ
์คํธ ํ์์. (์์ด ๊ธฐ์ค 30๋จ์ด๊ฐ 10์ด ์ ๋์ด๋ฏ๋ก ๋งค์ฐ ๊ธธ๋ค)
โช
ํฅ๋ฏธ๋ก์ด ์ ์ VoxCPM์ ๊ฒฝ์ฐ seed-tts-eval์์ VibeVoice๋ณด๋ค ์์ ์ ์ด๊ณ , ๋ฎ์ WER์ ๋ณด์๋๋ฐ, ๊ธด ๋ฌธ์ฅ์์ ๊ธ๊ฒฉํ๊ฒ ํ์ง์ด ๋จ์ด์ก๋ค. (์ค์ ๋ก ์ฌ์ฉํด๋ดค์ ๋์๋ repeat skip ๊ฑฐ์ ์์๋ค)
โข
VibeVoice๋ ์ ์ด์ ๊ธด ๋ฌธ์ฅ + multi-speaker dialogue์ contribution์ผ๋ก ๋์จ ์ฐ๊ตฌ์ด๋ค.
โข
chunking ํ๋ค๋ฉด, VoxCPM์ ๊ฒฝ์ฐ ํ์ง์ด ํจ์ฌ ์ข๊ฒ ๋์์ ๊ฒ. (์ ํ์์๋ ์ ๋ ๊ฒ ํธ์ถํ ๋ฆฌ๊ฐ ์๋ค.)
โข
HiggsAudioV2๋ ์๋๋ ์์ ์ฑ์ด ๋จ์ด์ง๋ ํธ์ธ๋ฐ, 2.5์์ ๋ง์ด ๊ฐ์ ๋์์.
โข
Review
โฆ
๊ฐ๋ ฅํ backbone๋ค๊ณผ ๋ฐฉ๋ฒ๋ก ์ผ๋ก ๊ณ ๋ํํ์ง๋ง.. ์ค์ง์ ์ธ ํ์ง๊ณผ efficiency ์ธก๋ฉด์์ ์ฌ์ ํ ๋ถ์กฑํด ๋ณด์ธ๋ค.
โฆ
๋ค๋ง, ์๋
์๋ง ํด๋ LLM-based ์ ๊ทผ ๋ฐฉ๋ฒ์ด speaker consistency๊ฐ ๋ฎ๊ณ , content fidelity(consistency)๊ฐ ๋งค์ฐ ๋ถ์์ ํ๋ ๊ฒ์ ๊ณ ๋ คํ๋ฉด, ์ด์ ์ผ์ ๋ถ๊ธฐ์ ์ ๋์ ๋๋.
โฆ
๋ค์ ๋ฒ์ (Qwen4-Audio)๋ถํฐ๋ ๊ธฐ์กด์ NAR ๋ฐฉ๋ฒ๋ก ๊ณผ๋ ํ์คํ gap์ ๋ง๋๋ ๊ฐ์ ๋ค์ด ์๊ฒจ๋ ๊ฒ์ผ๋ก ๊ธฐ๋๋๋ ๋ฉด์ด ์๋ค.





