OPD는 답보다 교사의 정책을 옮기고, 그래서 다중 교사에서 줄다리기가 된다
Every Coin Has Two Sides는 on-policy distillation이 교사의 문제별 정답보다 reasoning behavior를 전이하며, 같은 계보 teacher에서는 범위를 넓히지만 mul...
Tag
Every Coin Has Two Sides는 on-policy distillation이 교사의 문제별 정답보다 reasoning behavior를 전이하며, 같은 계보 teacher에서는 범위를 넓히지만 mul...
U-OPSD는 여러 on-policy rollout의 합의를 pseudo-solution으로 만들고, 그 합의와 갈린 trajectory에만 token-level distillation을 적용해 ground tr...
Latent Agents의 IMAD는 3개 에이전트의 토론 trace를 SFT로 학습한 뒤 GRPO의 동적 보상과 길이 클리핑으로 내재화해, 명시적 debate와 비슷하거나 더 나은 성능을 훨씬 적은 토큰으로 재...
Qwen-Scope는 Qwen3·Qwen3.5 계열 7개 모델에 대해 14개 그룹의 sparse autoencoder를 공개하고, 이를 추론 조종·벤치마크 분석·안전 데이터 합성·사후 훈련 최적화까지 연결해 SA...