Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis

Rating
4 - Good
Authors
Hila Chefer
Date
2026
Review Status
In Progress

SUMMARY

โ€ข
Motivation
โ—ฆ
REPA ์„ฑ๋Šฅ๊ณผ representation model
โ–ช
DINOv2-B > DINOv2-L > DINOv3 > DINOv3-H+
โ—ฆ
stronger representation learner๋กœ feature alignment ํ•˜๋Š” ๊ฒƒ์ด ์˜คํžˆ๋ ค bottleneck์ด ๋œ๋‹ค!
โ–ช
fixed representation์ด generative goal์—์„œ ๋–จ์–ด์ ธ ์žˆ๋‹ค.
โ—ฆ
generative framework ์ž์ฒด์—์„œ ํ•ด๊ฒฐํ•ด๋ณด์ž.
์ง๊ด€์ ์œผ๋กœ ๋” ์ข‹์€ representation์„ ์“ฐ๋ฉด ๋” ์ข‹์€ ๋ชจ๋ธ์ด ๋  ๊ฒƒ ๊ฐ™์€๋ฐ, ๊ฒฐ๊ตญ main objective๋Š” diffusion loss์ด๋‹ˆ, ๊ทธ ์•ˆ์—์„œ ์ƒํ˜ธ์ž‘์šฉ์„ ์ผ์œผํ‚ฌ ์ˆ˜ ์žˆ๋Š” ์ˆ˜์ค€์—์„œ์˜ term์„ ์‚ฌ์šฉํ•ด์•ผํ•œ๋‹ค๋Š” ๊ตํ›ˆ.
VAE๋„ ๊ทธ๋Ÿฐ๋ฐ, reconstruction quality์™€ representation์€ ์–ด๋А์ •๋„ trade-off ๊ด€๊ณ„์— ์žˆ๋‹ค.
ํ•˜์ง€๋งŒ ์• ์ดˆ์— VAE-based์ธ REPA์™€ ๋‹ฌ๋ฆฌ RAE๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค๋ฉด, target latent๋กœ ์‚ฌ์šฉํ•œ strong representation์ด ๋„์›€์ด ๋  ๊ฒƒ ๊ฐ™๋‹ค.
โ€ข
Method
โ—ฆ
teacher model์„ external model์ด ์•„๋‹Œ ๋” ์‰ฌ์šด noise ์—์„œ์˜ self forward๋กœ ํ™œ์šฉ
โ—ฆ
Noising method
โ–ช
token ๋ณ„ ๋‹ค๋ฅธ noise level
โ€ข
token ๋‚ด์—์„œ๋Š” ์ผ๊ด€๋œ noise distribution
โ–ช
Dual-Timestep Scheduling
โ€ข
Mask์— ํ•ด๋‹นํ•˜๋Š” ํ† ํฐ์—๋งŒ ๊ฐ•ํ•œ noise
โ—ฆ
Teacher
โ–ช
์•ฝํ•œ noise๋กœ forward ํ•˜๊ณ , higher layer(k)์—์„œ target feature๋กœ์จ ํ›ˆ๋ จ [SRA]
โ–ช
ฯ„min=min(ฯ„)โˆˆ{โ€‰t,sโ€‰}\tau_{min}=min(\tau)\in\set{t,s}
โ–ช
model์€ student model์„ EMA
โ€ข