Moshi: a speech-text foundation model for real-time dialogue

Rating
5 - Excellent
Authors
Kyutai
Date
2024
Review Status
In Progress

TL;DR

โ€ข
The first real-time full-duplex spoken LLM(7B)
โ€ข
Inner Monologue
โ€ข
Mimi codec
โ€ข
low latency(200ms)

Summary

โ€ข
Background and Motivation
โ—ฆ
Cascade ๊ตฌ์กฐ(STT-LLM-TTS)์˜ ํ•œ๊ณ„๋กœ ์ธํ•œ Full-duplex ํ•„์š”์„ฑ
โ–ช
๋ถ„๋ฆฌ๋œ ๋ชจ๋ธ๋กœ ์ธํ•œ ์ •๋ณด์˜ ์†์‹ค, ์ค‘์ฒฉ๋˜๋Š” latency
โ–ช
์œ„ ํ•œ๊ณ„๋กœ ์ธํ•ด real conversation์— ๊ฐ€๊น๋„๋ก ๋งŒ๋“ค๊ธฐ์— ๊ตฌ์กฐ์ ์ธ ๋ฌธ์ œ๊ฐ€ ๋ฐœ์ƒํ•จ
โ€ข
VAD๋ฅผ ์ด์šฉํ•œ speaker turn์— ์˜์กด
โ–ช
overlapping speech, interruptions๊นŒ์ง€ ๊ณ ๋ คํ•œ ์ƒˆ๋กœ์šด ๊ตฌ์กฐ ์ œ์•ˆ
โ€ข
Method
โ—ฆ
Helium, a 7B-parameter text LLM
โ–ช
LLM์œผ๋กœ์จ ํŠน๋ณ„ํ•  ๊ฒƒ์€ ์—†๊ณ , ์ด๋ฏธ ์œ ๋ช…ํ•œ ๊ตฌ์กฐ ์ฑ„ํƒ ๋ฐ ์ž์ฒด ํ›ˆ๋ จํ•œ ๋ชจ๋ธ. text pretrainingํ•œ ํ›„์— S2S๋กœ ํ›ˆ๋ จ ๋ชฉ์ .
โ–ช
Llama2 โ†” Gemma1 ์ˆ˜์ค€์˜ ์„ฑ๋Šฅ.
โ—ฆ
Mimi, a neural audio codec
โ–ช
12.5Hz frame rate
โ–ช
RVQ
โ–ช
์ฒซ๋ฒˆ์งธ: semantic codebook
โ–ช
2-Q(8): acoustic codebook
โ–ช
streaming์„ ์œ„ํ•ด causal ๊ตฌ์กฐ
โ–ช
loss๋Š” GAN-based vocoder ์™€ ๊ฑฐ์˜ ๊ฐ™์Œ.
โ—ฆ
Multi-stream Modeling
โ–ช
2-speaker conversation์œผ๋กœ ํ™•์žฅ (moshi / user)
โ—ฆ
Inner Monologue
โ–ช
linguistic quality๋ฅผ ๋†’์ด๊ธฐ ์œ„ํ•œ ์žฅ์น˜๋กœ text token ํ™œ์šฉ
โ–ช
user stream์—์„œ๋Š” ์‚ฌ์šฉํ•˜์ง€ ์•Š์Œ.
โ–ช
Aligning text and audio tokens
โ€ข
codec์ด 12.5Hz ์ด๊ธฐ ๋•Œ๋ฌธ์—, text token์„ timing์— ๋งž๊ฒŒ ๊ฐ™์ด ์ถ”์ •ํ•˜๋ ค๋ฉด align์ด ํ•„์š”ํ•˜๋‹ค.
โ€ข
์ €์ž๋“ค์€ Whisper word-level timestamp๋ฅผ ํ™œ์šฉํ•˜์˜€์Œ.
โ€ข
word-level์˜ ์‹œ์ž‘ ๋ถ€๊ทผ์— text token์„ ๋ฐฐ์น˜ํ•˜๊ณ , ๋‚จ์€ ๋ถ€๋ถ„์€ PAD/EPAD ํ† ํฐ ํ™œ์šฉ
โ—ฆ
EPAD๋Š” next token ์ง์ „์— PAD ๋Œ€์‹  ์‚ฌ์šฉ
โ€ข
(scalable approach๋Š” ์•„๋‹Œ ๊ฒƒ ๊ฐ™๋‹ค. whisper timestamp๋Š” ๊ทธ๋‹ค์ง€ ์ •ํ™•ํ•˜์ง€๋„ ์•Š๋‹ค.)
โ€ข
์˜์–ด ๊ธฐ์ค€์œผ๋กœ 65%๊ฐ€ PAD ํ† ํฐ์ด๋‹ค.
โ—ฆ

Review

โ€ข
full-duplex๋ฅผ ์œ„ํ•œ ํ•˜๋‚˜์˜ ๋ชจ๋ธ ์ œ์•ˆ์œผ๋กœ์จ ์˜๋ฏธ ์žˆ๋Š” ์—ฐ๊ตฌ.
โ—ฆ
์ „์ฒด ์‹œ์Šคํ…œ์„ ์œ„ํ•ด์„œ๋Š” ์‹ ๊ฒฝ์“ธ ๋ถ€๋ถ„์ด ์ƒ๋‹นํžˆ ๋งŽ์€๋ฐ, ๊ทธ์— ๋น„๋ก€ํ•˜๋Š” ๋…ผ๋ฌธ์˜ ๊ธธ์ด
โ€ข
๊ผญ full-duplex๊ฐ€ ํ•„์š”ํ• ๊นŒ?
โ—ฆ
์šฉ๋„์— ๋”ฐ๋ผ ๋‹ค๋ฅด๊ฒ ์œผ๋‚˜, ์ธ๊ฐ„๊ณผ ์Œ์„ฑ์œผ๋กœ ์†Œํ†ตํ•˜๋Š” task์—๋Š” ํ•„์š”ํ•˜๋‹ค.
โ—ฆ
single speaker synthesis, multi-speaker dialogue(w/o user voice), multi-modal generation ๋“ฑ ์ปจํ…์ธ  ์ œ์ž‘์—๋Š” ๊ตณ์ด ํ•„์š”ํ•˜์ง€ ์•Š์•„ ๋ณด์ธ๋‹ค. ๋ฐ์ดํ„ฐ ์„ธํŒ… ๋ฌธ์ œ.
โ€ข
๊ทธ๊ฒŒ ๋ชจ๋ธ ํ•˜๋‚˜๋กœ ์ฒ˜๋ฆฌํ•ด์•ผ๋งŒ ํ•˜๋Š” ๋ฌธ์ œ์ธ๊ฐ€?
โ—ฆ
latency ๋ฌธ์ œ๋Š” ์‹œ์Šคํ…œ์˜ ์™„์„ฑ๋„๊ฐ€ ์˜ฌ๋ผ๊ฐˆ์ˆ˜๋ก ๊ทน๋ณต ๊ฐ€๋Šฅํ•ด ๋ณด์ธ๋‹ค.
โ—ฆ
ํ•˜์ง€๋งŒ ๋ฐœํ™” ์ •๋ณด๊ฐ€ text๋กœ ๋ณ€ํ™˜๋˜๋Š” ์ˆœ๊ฐ„ ๋งŽ์€ ์ •๋ณด๊ฐ€ ์‚ฌ๋ผ์ง€๋Š”๋ฐ, ์—ฌ๊ธฐ์— ์ž์—ฐ์Šค๋Ÿฌ์šด ๋Œ€ํ™”๋ฅผ ์œ„ํ•ด ์ค‘์š”ํ•œ ์ •๋ณด๋“ค์ด ์žˆ๋‹ค.
โ—ฆ
๊ฒฐ๊ตญ ์ž…๋ ฅ ๋ฐ์ดํ„ฐ(์ •๋ณด)๊ฐ€ ๊ฒฐํ•๋˜์–ด ๋ฐœ์ƒํ•˜๋Š” ๊ฐ„๊ทน์ด๋ฏ€๋กœ, ์ด ์ •๋ณด๋ฅผ ์ถ”์ ํ•  ์ˆ˜ ์žˆ๋Š” ๋ณ„๋„์˜ ํ†ต๋กœ๊ฐ€ ์žˆ๋‹ค๋ฉด, ๋ชจ๋ธ์ด ํ•˜๋‚˜๊ฐ€ ์•„๋‹ˆ์–ด๋„ ๋œ๋‹ค.
โ—ฆ
๋‹ค๋งŒ ๋Œ€ํ™”์˜ ํ˜ธํก์„ ์ดํ•ดํ•œ๋‹ค๋Š” ๋ฌธ์ œ๋Š” ๋ณตํ•ฉ์ ์ด๊ณ , ๋ฏธ๋ฌ˜ํ•œ ๋ฌธ์ œ์ด๋ฏ€๋กœ, ์ด๋ฅผ ๋‹จ์ˆœํ™” ์‹œํ‚จ ์–ด๋–ค ํŠน์ •ํ•œ task๋กœ ํ›ˆ๋ จ์‹œํ‚ค๊ธฐ๊ฐ€ ์–ด๋ ต๋‹ค. ์ฆ‰, ๋Œ€ํ™” ์ž์ฒด๋ฅผ ํ†ต์œผ๋กœ ํ›ˆ๋ จํ•œ ๋ชจ๋ธ์ด ์•„๋‹ˆ๋ผ๋ฉด, ์–ธ์ œ ๋ฆฌ์•ก์…˜ํ•˜๊ณ , ๋ง ๋๋‚ฌ๋Š”์ง€ ์ดํ•ด(silence๋ผ๊ณ  ๋ง์ด ๋๋‚œ ๊ฒƒ์€ ์•„๋‹ˆ๋‹ค)ํ•˜๊ณ  ํ•˜๋Š” task๋ฅผ ๋ณ„๋„๋กœ ํ›ˆ๋ จํ•˜๊ธฐ ์–ด๋ ต๋‹ค๋Š” ๊ฒƒ. ๊ทธ๋Ÿฐ label์ด ์ผ์ผ์ด ๋‹ฌ๋ฆฐ ๋ฐ์ดํ„ฐ๋ฅผ ๋งŒ๋“œ๋Š” ๊ฒƒ๋ณด๋‹ค, ๋Œ€ํ™”๋ฅผ ํ†ต์œผ๋กœ ์ดํ•ด์‹œํ‚ค๋Š” ๊ฒƒ์ด ๋” ๊ฐ„๋‹จํ•œ ์ผ์ด๋‹ค.
โ—ฆ
์ฆ‰, ํ˜„์žฌ๋Š” ํ’ˆ์งˆ ๋ฉด์—์„œ ๋ดค์„ ๋•Œ ๋ชจ๋ธ ํ•˜๋‚˜๋ฅผ ์ž˜ ํ›ˆ๋ จ์‹œํ‚ค๋Š” ๊ฒƒ๋ณด๋‹ค ๋” ์ข‹์€ ๋ฐฉ๋ฒ•๋ก ์€ ๋– ์˜ค๋ฅด์ง€ ์•Š๋Š”๋‹ค. (๋ฌผ๋ก  ์ ๋‹นํ•œ ์ˆ˜์ค€์—์„œ ๋ถ„๋ฆฌํ•ด์„œ ๋งŒ๋“œ๋Š” ๊ฒƒ์€ ๊ฐ€๋Šฅํ•  ๊ฒƒ)
โ€ข
๋‹จ์ ์€ ์—†๋‚˜?
โ—ฆ
๊ฒฐ๊ตญ ํ•˜๋‚˜์˜ ๋ชจ๋ธ์ด๋ผ๋ฉด, LLM ํ’ˆ์งˆ์ด ๊ด€๊ฑด์ด๋‹ค.
โ—ฆ
frontier LLM๋“ค์€ 320B์„ ๋„˜์–ด์„ ๋‹ค. 7B ๋ชจ๋ธ๋“ค์˜ LLM ์„ฑ๋Šฅ์ด ์ถฉ๋ถ„ํ•˜์ง€ ์•Š๋‹ค.
โ—ฆ
์‹ฌ์ง€์–ด ์ถ”๋ก  ๋ชจ๋ธ๋“ค์€ reasoning ๊ณผ์ •๋“ค์ด ์žˆ๊ณ , LLM์˜ ์ž…์ถœ๋ ฅ ๊ณผ์ •์ด speech ์ถœ๋ ฅ๊ณผ ์ผ์น˜๋˜์ง€ ์•Š๋Š”๋‹ค.
โ—ฆ
๋‹จ์ˆœํ•œ speech to speech ๋ชจ๋ธ์€ ํ•œ๊ณ„๊ฐ€ ์žˆ๊ณ , ์š”์ฆ˜(2026) ์ด ๊ฐ„๊ทน์„ ๋ฉ”์šฐ๊ธฐ ์œ„ํ•œ ํ˜•ํƒœ๋กœ ์—ฐ๊ตฌ๊ฐ€ ์ง„ํ–‰๋˜๋Š”๋“ฏ ํ•˜๋‹ค.
โ—ฆ
๋น„์šฉ์— ์ œํ•œ์ด ์—†๋‹ค๋ฉด, ํ•˜๋‚˜์˜ ๋ชจ๋ธ๋กœ multi-modal understanding/generation ์ด ํ†ตํ•ฉ๋œ ์‹œ์Šคํ…œ์ด ์ฃผ๋ฅผ ์ด๋ฃจ๊ฒŒ ๋ ํ…Œ๊ณ , ํ˜„์‹ค์ ์ธ ์ œ์•ฝ์œผ๋กœ ์ธํ•ด ๋ถ„๋ฆฌ ๋œ ์ ๋‹นํ•œ ์‹œ์Šคํ…œ๋„ ๋‹น๋ถ„๊ฐ„์€ ํ•„์š”ํ•œ ํšŒ์‚ฌ๋“ค์˜ ๋‹ˆ์ฆˆ๊ฐ€ ์žˆ์„ ๊ฒƒ ๊ฐ™๋‹ค.