전문가 모델을 여럿 만든 뒤 하나의 학생 모델로 능력을 옮기는 것은 매력적이지만, 교사 선택만으로 능력이 균형 있게 합쳐지지는 않는다.
각 교사가 내는 학습 신호의 크기가 다르면 동일한 프롬프트 수를 배정해도 공유 학생의 업데이트는 특정 도메인에 끌려갈 수 있다.

Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation은 이 문제를 Qwen3.5의 수학·코드·지시 따르기 전문가로 분석한다.
저자들의 진단은 명확하다.
MOPD의 라우팅은 “누가 가르칠지”는 정하지만, 각 도메인의 피드백이 “얼마나 강하게 반영될지”는 보정하지 않는다.

무엇을 해결하려는가

Multi-Teacher On-Policy Distillation(MOPD)은 학생이 직접 생성한 답변을 해당 도메인의 전문가가 평가해 토큰별 학습 신호를 주는 방식이다.
학생의 실제 생성 분포에서 훈련하므로 고정된 교사 답안만 모아 학습하는 방식보다 on-policy라는 장점이 있다.
하지만 여러 전문가가 서로 다른 강화학습 파이프라인으로 만들어졌다면 토큰별 teacher-student log-ratio의 분포 폭도 달라질 수 있다.

논문은 세 크기의 Qwen3.5 실험에서 기본 MOPD가 가장 강한 단일 전문가 학생보다 나아지지 않았고 수학 전문가의 이득도 충분히 옮기지 못했다고 보고한다.
첫 배치에서 instruction-following 신호는 수학 신호보다 크게 퍼져 있었으며, 4B 학생의 결합 그래디언트에서 instruction-following 손실이 94%를 차지했다.
프롬프트 도메인 라벨이 같아도 실제 업데이트 영향력은 같지 않았다는 뜻이다.

핵심 아이디어: 도메인별 신호 분산 정규화

DN-MOPD는 기존 도메인 라우팅과 학생의 on-policy 응답 생성을 유지하고, 학생 업데이트 직전에 도메인별 distillation advantage의 표준편차를 측정한다.
각 도메인 신호에 전체 배치와 해당 도메인의 표준편차 비율을 곱하고, 배율을 0.25~4로 제한한다.
표본이 2개 미만이거나 어느 쪽 표준편차가 0이면 해당 도메인은 기본 배율 1을 쓴다.
이는 논문이 정의한 배치별 보정 규칙이다.

따라서 신호의 부호, 즉 특정 토큰을 더 권장할지 덜 권장할지는 보존하면서 규모만 조정한다.
학습된 router나 추가 teacher 호출이 필요한 구조는 아니다.
다만 IF 도메인의 배율이 실험에서 자주 하한 0.25에 걸려, 분산이 완전히 같아지는 것은 아니다.
표준편차는 도메인 비율과 도메인 간 평균 차이에도 영향을 받고, 손실은 응답 단위로 평균을 내므로 이 규칙이 도메인별 그래디언트나 손실 기여도를 균등화한다고 볼 수 없다.

공개된 근거에서 확인되는 점

평가는 AIME25·AIME26, LiveCodeBench v5·v6, IFEval, IFBench 여섯 공개 세트를 사용하고 2B·4B·9B 학생을 비교한다.
논문은 DN-MOPD가 모든 크기에서 라벨 라우팅 MOPD보다 평균 점수를 개선한다고 보고한다.
16K 평가 한도에서 MOPD 대비 평균 향상 폭은 크기에 따라 1.172.36%p, 8K에서는 2.473.08%p다.
세 시드는 학생 훈련 시드이며, 교사 풀을 새로 학습한 반복은 아니다.
일부 크기에서는 가장 강한 단일 교사 학생을 넘는 구간이 통계적으로 불확실하고, SeqKD-SFT와 task arithmetic은 각기 다른 훈련 예산에서 더 높은 Total 점수를 내기도 한다.

대조 실험의 해석도 중요하다.
수학 신호를 단순히 키우는 것보다 instruction-following 신호를 줄이는 것이 이득의 주된 원인이었다.
측정된 DN-MOPD 배율과 가까운 고정 가중치는 9B·4B에서 비슷한 성능을 냈고, 2B에서는 배치별 추정이 더 나았다.
또 8K·16K 응답 한도는 두 설정을 비교해 선택된 평가 조건이므로, 이를 폭넓은 길이 일반화 검증으로 해석하기는 어렵다.
별도의 초기 Qwen3-4B 실험에서는 뚜렷한 DN-MOPD 이득이 확인되지 않아, 결론은 Qwen3.5 전문가 풀의 통제 실험 범위에 한정된다.

실무 관점에서의 해석

멀티 도메인 학습을 설계할 때 데이터 비율이나 교사 라우팅만 확인해서는 부족하다.
각 목적 함수가 실제 공유 파라미터 업데이트에 미치는 크기를 측정해야 한다.
특히 교사들이 서로 다른 보상·최적화 레시피로 만들어졌다면 “같은 수의 예시”는 “같은 학습 영향력”을 뜻하지 않는다.

DN-MOPD의 실용적 기여는 복잡한 라우터를 추가하기보다 신호 분포를 관찰하고 스케일을 조정하는 간단한 진단을 제안한 데 있다.
다만 결과는 특정 Qwen3.5 전문가 풀과 학습 설정에 기반하며, 분산을 맞추는 것이 도메인 간 상충이나 평가 편향을 해결하지는 않는다.
다른 모델 계열과 더 다양한 도메인에서 재현하는 것이 다음 확인 단계다.

참고 자료