COBRA-Skills는 ‘더 많은 스킬 후보’ 대신 ‘다음에 평가할 후보’를...
COBRA-Skills는 contextual bandit으로 실행 평가 예산을 유망하거나 덜 탐색된 agent skill에 배분하고, 실제 rollout 증거로 후보군을 재생성·변이·교차하는 skill-optim...
Tag
COBRA-Skills는 contextual bandit으로 실행 평가 예산을 유망하거나 덜 탐색된 agent skill에 배분하고, 실제 rollout 증거로 후보군을 재생성·변이·교차하는 skill-optim...
arXiv 2606.05828은 개인 에이전트의 스킬 선택을 LLM의 메모리 프롬프트에 맡기는 대신, 로컬 통계 priors와 좁은 LLM override probe로 분리하는 Local Harness를 제안한다...