SUMMARY
โข
Motivation
โฆ
REPA ์ฑ๋ฅ๊ณผ representation model
โช
DINOv2-B > DINOv2-L > DINOv3 > DINOv3-H+
โฆ
stronger representation learner๋ก feature alignment ํ๋ ๊ฒ์ด ์คํ๋ ค bottleneck์ด ๋๋ค!
โช
fixed representation์ด generative goal์์ ๋จ์ด์ ธ ์๋ค.
โฆ
generative framework ์์ฒด์์ ํด๊ฒฐํด๋ณด์.
์ง๊ด์ ์ผ๋ก ๋ ์ข์ representation์ ์ฐ๋ฉด ๋ ์ข์ ๋ชจ๋ธ์ด ๋ ๊ฒ ๊ฐ์๋ฐ, ๊ฒฐ๊ตญ main objective๋ diffusion loss์ด๋, ๊ทธ ์์์ ์ํธ์์ฉ์ ์ผ์ผํฌ ์ ์๋ ์์ค์์์ term์ ์ฌ์ฉํด์ผํ๋ค๋ ๊ตํ.
VAE๋ ๊ทธ๋ฐ๋ฐ, reconstruction quality์ representation์ ์ด๋์ ๋ trade-off ๊ด๊ณ์ ์๋ค.
ํ์ง๋ง ์ ์ด์ VAE-based์ธ REPA์ ๋ฌ๋ฆฌ RAE๋ฅผ ์ฌ์ฉํ๋ค๋ฉด, target latent๋ก ์ฌ์ฉํ strong representation์ด ๋์์ด ๋ ๊ฒ ๊ฐ๋ค.
โข
Method
โฆ
teacher model์ external model์ด ์๋ ๋ ์ฌ์ด noise ์์์ self forward๋ก ํ์ฉ
โฆ
Noising method
โช
token ๋ณ ๋ค๋ฅธ noise level
โข
token ๋ด์์๋ ์ผ๊ด๋ noise distribution
โช
Dual-Timestep Scheduling
โข
Mask์ ํด๋นํ๋ ํ ํฐ์๋ง ๊ฐํ noise
โฆ
Teacher
โช
โช
โช
model์ student model์ EMA
โข





