TL;DR
โข
The first real-time full-duplex spoken LLM(7B)
โข
Inner Monologue
โข
Mimi codec
โข
low latency(200ms)
Summary
โข
Background and Motivation
โฆ
Cascade ๊ตฌ์กฐ(STT-LLM-TTS)์ ํ๊ณ๋ก ์ธํ Full-duplex ํ์์ฑ
โช
๋ถ๋ฆฌ๋ ๋ชจ๋ธ๋ก ์ธํ ์ ๋ณด์ ์์ค, ์ค์ฒฉ๋๋ latency
โช
์ ํ๊ณ๋ก ์ธํด real conversation์ ๊ฐ๊น๋๋ก ๋ง๋ค๊ธฐ์ ๊ตฌ์กฐ์ ์ธ ๋ฌธ์ ๊ฐ ๋ฐ์ํจ
โข
VAD๋ฅผ ์ด์ฉํ speaker turn์ ์์กด
โช
overlapping speech, interruptions๊น์ง ๊ณ ๋ คํ ์๋ก์ด ๊ตฌ์กฐ ์ ์
โข
Method
โฆ
Helium, a 7B-parameter text LLM
โช
LLM์ผ๋ก์จ ํน๋ณํ ๊ฒ์ ์๊ณ , ์ด๋ฏธ ์ ๋ช
ํ ๊ตฌ์กฐ ์ฑํ ๋ฐ ์์ฒด ํ๋ จํ ๋ชจ๋ธ. text pretrainingํ ํ์ S2S๋ก ํ๋ จ ๋ชฉ์ .
โช
Llama2
Gemma1 ์์ค์ ์ฑ๋ฅ.
โฆ
Mimi, a neural audio codec
โช
12.5Hz frame rate
โช
RVQ
โช
์ฒซ๋ฒ์งธ: semantic codebook
โช
2-Q(8): acoustic codebook
โช
streaming์ ์ํด causal ๊ตฌ์กฐ
โช
loss๋ GAN-based vocoder ์ ๊ฑฐ์ ๊ฐ์.
โฆ
Multi-stream Modeling
โช
2-speaker conversation์ผ๋ก ํ์ฅ (moshi / user)
โฆ
Inner Monologue
โช
linguistic quality๋ฅผ ๋์ด๊ธฐ ์ํ ์ฅ์น๋ก text token ํ์ฉ
โช
user stream์์๋ ์ฌ์ฉํ์ง ์์.
โช
Aligning text and audio tokens
โข
codec์ด 12.5Hz ์ด๊ธฐ ๋๋ฌธ์, text token์ timing์ ๋ง๊ฒ ๊ฐ์ด ์ถ์ ํ๋ ค๋ฉด align์ด ํ์ํ๋ค.
โข
์ ์๋ค์ Whisper word-level timestamp๋ฅผ ํ์ฉํ์์.
โข
word-level์ ์์ ๋ถ๊ทผ์ text token์ ๋ฐฐ์นํ๊ณ , ๋จ์ ๋ถ๋ถ์ PAD/EPAD ํ ํฐ ํ์ฉ
โฆ
EPAD๋ next token ์ง์ ์ PAD ๋์ ์ฌ์ฉ
โข
(scalable approach๋ ์๋ ๊ฒ ๊ฐ๋ค. whisper timestamp๋ ๊ทธ๋ค์ง ์ ํํ์ง๋ ์๋ค.)
โข
์์ด ๊ธฐ์ค์ผ๋ก 65%๊ฐ PAD ํ ํฐ์ด๋ค.
โฆ
Review
โข
full-duplex๋ฅผ ์ํ ํ๋์ ๋ชจ๋ธ ์ ์์ผ๋ก์จ ์๋ฏธ ์๋ ์ฐ๊ตฌ.
โฆ
์ ์ฒด ์์คํ
์ ์ํด์๋ ์ ๊ฒฝ์ธ ๋ถ๋ถ์ด ์๋นํ ๋ง์๋ฐ, ๊ทธ์ ๋น๋กํ๋ ๋
ผ๋ฌธ์ ๊ธธ์ด
โข
๊ผญ full-duplex๊ฐ ํ์ํ ๊น?
โฆ
์ฉ๋์ ๋ฐ๋ผ ๋ค๋ฅด๊ฒ ์ผ๋, ์ธ๊ฐ๊ณผ ์์ฑ์ผ๋ก ์ํตํ๋ task์๋ ํ์ํ๋ค.
โฆ
single speaker synthesis, multi-speaker dialogue(w/o user voice), multi-modal generation ๋ฑ ์ปจํ
์ธ ์ ์์๋ ๊ตณ์ด ํ์ํ์ง ์์ ๋ณด์ธ๋ค. ๋ฐ์ดํฐ ์ธํ
๋ฌธ์ .
โข
๊ทธ๊ฒ ๋ชจ๋ธ ํ๋๋ก ์ฒ๋ฆฌํด์ผ๋ง ํ๋ ๋ฌธ์ ์ธ๊ฐ?
โฆ
latency ๋ฌธ์ ๋ ์์คํ
์ ์์ฑ๋๊ฐ ์ฌ๋ผ๊ฐ์๋ก ๊ทน๋ณต ๊ฐ๋ฅํด ๋ณด์ธ๋ค.
โฆ
ํ์ง๋ง ๋ฐํ ์ ๋ณด๊ฐ text๋ก ๋ณํ๋๋ ์๊ฐ ๋ง์ ์ ๋ณด๊ฐ ์ฌ๋ผ์ง๋๋ฐ, ์ฌ๊ธฐ์ ์์ฐ์ค๋ฌ์ด ๋ํ๋ฅผ ์ํด ์ค์ํ ์ ๋ณด๋ค์ด ์๋ค.
โฆ
๊ฒฐ๊ตญ ์
๋ ฅ ๋ฐ์ดํฐ(์ ๋ณด)๊ฐ ๊ฒฐํ๋์ด ๋ฐ์ํ๋ ๊ฐ๊ทน์ด๋ฏ๋ก, ์ด ์ ๋ณด๋ฅผ ์ถ์ ํ ์ ์๋ ๋ณ๋์ ํต๋ก๊ฐ ์๋ค๋ฉด, ๋ชจ๋ธ์ด ํ๋๊ฐ ์๋์ด๋ ๋๋ค.
โฆ
๋ค๋ง ๋ํ์ ํธํก์ ์ดํดํ๋ค๋ ๋ฌธ์ ๋ ๋ณตํฉ์ ์ด๊ณ , ๋ฏธ๋ฌํ ๋ฌธ์ ์ด๋ฏ๋ก, ์ด๋ฅผ ๋จ์ํ ์ํจ ์ด๋ค ํน์ ํ task๋ก ํ๋ จ์ํค๊ธฐ๊ฐ ์ด๋ ต๋ค. ์ฆ, ๋ํ ์์ฒด๋ฅผ ํต์ผ๋ก ํ๋ จํ ๋ชจ๋ธ์ด ์๋๋ผ๋ฉด, ์ธ์ ๋ฆฌ์ก์
ํ๊ณ , ๋ง ๋๋ฌ๋์ง ์ดํด(silence๋ผ๊ณ ๋ง์ด ๋๋ ๊ฒ์ ์๋๋ค)ํ๊ณ ํ๋ task๋ฅผ ๋ณ๋๋ก ํ๋ จํ๊ธฐ ์ด๋ ต๋ค๋ ๊ฒ. ๊ทธ๋ฐ label์ด ์ผ์ผ์ด ๋ฌ๋ฆฐ ๋ฐ์ดํฐ๋ฅผ ๋ง๋๋ ๊ฒ๋ณด๋ค, ๋ํ๋ฅผ ํต์ผ๋ก ์ดํด์ํค๋ ๊ฒ์ด ๋ ๊ฐ๋จํ ์ผ์ด๋ค.
โฆ
์ฆ, ํ์ฌ๋ ํ์ง ๋ฉด์์ ๋ดค์ ๋ ๋ชจ๋ธ ํ๋๋ฅผ ์ ํ๋ จ์ํค๋ ๊ฒ๋ณด๋ค ๋ ์ข์ ๋ฐฉ๋ฒ๋ก ์ ๋ ์ค๋ฅด์ง ์๋๋ค. (๋ฌผ๋ก ์ ๋นํ ์์ค์์ ๋ถ๋ฆฌํด์ ๋ง๋๋ ๊ฒ์ ๊ฐ๋ฅํ ๊ฒ)
โข
๋จ์ ์ ์๋?
โฆ
๊ฒฐ๊ตญ ํ๋์ ๋ชจ๋ธ์ด๋ผ๋ฉด, LLM ํ์ง์ด ๊ด๊ฑด์ด๋ค.
โฆ
frontier LLM๋ค์ 320B์ ๋์ด์ ๋ค. 7B ๋ชจ๋ธ๋ค์ LLM ์ฑ๋ฅ์ด ์ถฉ๋ถํ์ง ์๋ค.
โฆ
์ฌ์ง์ด ์ถ๋ก ๋ชจ๋ธ๋ค์ reasoning ๊ณผ์ ๋ค์ด ์๊ณ , LLM์ ์
์ถ๋ ฅ ๊ณผ์ ์ด speech ์ถ๋ ฅ๊ณผ ์ผ์น๋์ง ์๋๋ค.
โฆ
๋จ์ํ speech to speech ๋ชจ๋ธ์ ํ๊ณ๊ฐ ์๊ณ , ์์ฆ(2026) ์ด ๊ฐ๊ทน์ ๋ฉ์ฐ๊ธฐ ์ํ ํํ๋ก ์ฐ๊ตฌ๊ฐ ์งํ๋๋๋ฏ ํ๋ค.
โฆ
๋น์ฉ์ ์ ํ์ด ์๋ค๋ฉด, ํ๋์ ๋ชจ๋ธ๋ก multi-modal understanding/generation ์ด ํตํฉ๋ ์์คํ
์ด ์ฃผ๋ฅผ ์ด๋ฃจ๊ฒ ๋ ํ
๊ณ , ํ์ค์ ์ธ ์ ์ฝ์ผ๋ก ์ธํด ๋ถ๋ฆฌ ๋ ์ ๋นํ ์์คํ
๋ ๋น๋ถ๊ฐ์ ํ์ํ ํ์ฌ๋ค์ ๋์ฆ๊ฐ ์์ ๊ฒ ๊ฐ๋ค.




