U-OPSD는 모델 자신의 다수결을 teacher context로 바꿔 정답 없...
U-OPSD는 여러 on-policy rollout의 합의를 pseudo-solution으로 만들고, 그 합의와 갈린 trajectory에만 token-level distillation을 적용해 ground tr...
Tag
U-OPSD는 여러 on-policy rollout의 합의를 pseudo-solution으로 만들고, 그 합의와 갈린 trajectory에만 token-level distillation을 적용해 ground tr...
Visual Contrastive Self-Distillation(VCSD)은 EMA teacher가 원본 이미지와 content-erased control에서 낸 token distribution의 차이를 이용...
arXiv 2607.14777의 SEED는 완료된 on-policy trajectory에서 hindsight skill을 만들고, 같은 행동을 skill 유무 두 문맥에서 재채점해 GRPO에 dense token...