표현 오토인코더(RAE)는 사전학습된 비전 인코더의 특징을 이미지 생성 모델의 잠재공간으로 활용한다.
관건은 인코더의 여러 층 중 무엇을 생성기와 픽셀 디코더의 공통 입력으로 삼을지다.
얕은 층은 픽셀의 미세한 정보를 잘 보존하지만, 깊은 층은 의미적 표현과 생성 지표에 유리할 수 있어 하나의 고정 융합이 서로 다른 목적을 묶어 버린다.
FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders는 최적의 층 조합 하나를 더 정교하게 고르는 대신, 여러 조합을 견디는 디코더와 생성기를 학습한다.
핵심은 인코더 층의 무작위 부분집합을 훈련 때 보여주되, 평균적으로 전체 층 융합 표현을 보존하도록 정규화하는 것이다.
무엇을 해결하려는가
RAE에서는 인코더 특징을 합쳐 만든 잠재표현을 디코더가 픽셀로 복원하고, diffusion transformer(DiT)는 그 잠재표현의 분포를 학습한다.
그런데 복원 손실은 저층의 세부 정보를 선호하고, 생성 품질은 더 깊은 층의 의미 정보를 선호할 수 있다.
RAEv2의 고정된 마지막 층 합산처럼 한 가지 규칙을 쓰면 한 작업에 좋은 표현이 다른 작업에는 제약이 된다.
저자들은 DINOv3-L과 ImageNet-256에서 이 긴장을 분석한다.
논문 및 프로젝트 페이지의 RAEv2 비교에서 마지막 7개 층 대신 23개 층을 합치면 재구성 PSNR은 22.58dB에서 27.04dB로 높아지지만, 무조건부 gFID는 1.65에서 3.01로 나빠진다.
고정 퓨전은 단순한 입력 전처리가 아니라 생성기와 디코더 사이의 인터페이스이며, 그 인터페이스가 한 구성을 전제로 학습되면 생성기는 다른 구성의 잠재공간을 다루기 어렵다.
핵심 아이디어: 무작위 부분집합을 학습 입력으로
논문의 수학적 정식화에서 FuseReg는 훈련 중 매 샘플마다 인코더 층의 비어 있지 않은 부분집합을 표본화해 정규화된 평균 잠재표현을 만든다.
이 분포 아래 기대값은 전체 층 평균과 일치한다.
이로써 디코더는 얕은 층 하나에만 의존하는 지름길을 덜 학습하고, 완전·희소·단일 층 융합을 모두 받아들일 수 있도록 훈련된다.
다만 공개 구현은 모든 층이 탈락하는 경우 임의의 층 하나를 보존하는 별도 처리와 마지막 층 토큰 평균 surrogate를 사용한다고 재현 문서가 설명하므로, 논문 정식화와 코드 경로를 동일시하면 안 된다.
생성기에도 같은 원리를 적용한다.
DiT에는 부분집합 융합으로 만든 noisy latent를 입력하되, 예측 목표는 전체 층 융합 표현으로 유지한다.
디코더와 생성기는 같은 정규화 원리를 공유하지만 서로 다른 과제를 풀기 때문에 층 드롭 강도는 따로 설정할 수 있다.

이 방법은 고정 퓨전 선택을 무작위화하는 dropout류의 발상과 닮았지만, 목적은 추론 때 비용을 줄이는 것이 아니다.
다운스트림 모듈이 여러 층 조합에 견디게 하는 것이다.
이론 분석은 부분집합 표본화가 전체 층 평균을 보존하면서 층 간 불일치에 민감한 정도를 페널티로 만든다고 설명한다.
공개된 근거에서 확인되는 점
ImageNet-256의 DINOv3-L 실험에서 FuseReg 디코더 하나는 재학습 없이 전체·희소·단일 층 융합을 복원한다.
논문은 고정 융합별로 따로 훈련한 디코더보다 더 높은 PSNR을 달성했다고 보고한다.
생성 측면에서는 기존 RAEv2 DiT-XL을 그대로 둔 채 FuseReg 디코더로 교체했을 때 무조건부 gFID가 27% 개선되고, 디코더와 생성기 양쪽에 적용한 DiT-Base 설정에서는 gFID가 29% 낮아졌다고 보고한다.
이 비교는 해석을 나눠 볼 필요가 있다.
디코더 교체 실험은 생성기 자체를 바꾸지 않고 출력 디코딩 단계의 효과를 분리한다.
두 단계 모두 정규화한 실험은 생성기 표현 학습도 함께 바꾼다.
따라서 두 퍼센트를 하나의 동일 조건 효과처럼 읽기보다, 각 단계의 적용 범위가 다른 결과로 보아야 한다.
다른 사전학습 인코더 계열에서도 이점이 관찰됐다는 것이 일반화 가능성의 추가 근거다.
실무 관점에서의 해석
FuseReg의 설계 포인트는 “좋은 latent를 찾아 고정한다”가 아니라 “latent를 만드는 선택이 달라져도 소비자가 무너지지 않게 한다”는 것이다.
비전 인코더의 층 표현을 downstream 생성·복원 시스템에서 재사용할 때, 인터페이스를 하나의 경험적 융합 규칙에 고정하지 않는 접근은 모델 교체와 실험 반복을 유연하게 만들 수 있다.
다만 결과는 특정 데이터셋, 인코더, 디코더·DiT 규모와 학습 설정에 의존한다.
저장소의 재현 현황 문서는 175개 평가 항목이 모두 not_run이며 수치 재현이 아직 성립하지 않았다고 표시한다.
이는 논문의 결과와 코드 공개를 구분해 읽어야 한다는 뜻이다.
층 융합에 대한 강건성이 다른 해상도나 데이터 분포, 인코더 업데이트 조건에서도 같은 정도로 유효한지는 별도 검증이 필요하다.
논문이 주장하는 추가 학습 비용·구조 변경 없음도 제안된 실험 구성의 비교 기준 안에서 이해해야 한다.