Skill Entropy는 LLM의 장기 추론을 ‘정답률’이 아니라 ‘기술 전환...
Skill²-Bench와 Skill-Entropy RL은 긴 reasoning chain에서 모델이 앞 단계의 기술을 관성적으로 재사용하지 않고 다음 단계에 맞는 skill로 전환하는 능력을 측정하고 훈련하는 프...
Tag
Skill²-Bench와 Skill-Entropy RL은 긴 reasoning chain에서 모델이 앞 단계의 기술을 관성적으로 재사용하지 않고 다음 단계에 맞는 skill로 전환하는 능력을 측정하고 훈련하는 프...