D³-MOPD는 멀티티처 증류의 도메인 비중을 학습 중에 다시 배분한다
D³-MOPD는 multi-teacher on-policy distillation에서 이미 계산되는 도메인별 reverse-KL을 이용해, 빠르게 수렴한 도메인에서 아직 개선 중인 도메인으로 rollout 예산을...
Tag
D³-MOPD는 multi-teacher on-policy distillation에서 이미 계산되는 도메인별 reverse-KL을 이용해, 빠르게 수렴한 도메인에서 아직 개선 중인 도메인으로 rollout 예산을...
Every Coin Has Two Sides는 on-policy distillation이 교사의 문제별 정답보다 reasoning behavior를 전이하며, 같은 계보 teacher에서는 범위를 넓히지만 mul...
U-OPSD는 여러 on-policy rollout의 합의를 pseudo-solution으로 만들고, 그 합의와 갈린 trajectory에만 token-level distillation을 적용해 ground tr...
Visual Contrastive Self-Distillation(VCSD)은 EMA teacher가 원본 이미지와 content-erased control에서 낸 token distribution의 차이를 이용...
arXiv 2607.14777의 SEED는 완료된 on-policy trajectory에서 hindsight skill을 만들고, 같은 행동을 skill 유무 두 문맥에서 재채점해 GRPO에 dense token...