Repo-To-Skill은 GitHub 저장소를 실행 가능한 연구 에이전트 지식...
Repo-To-Skill은 DisCo가 repository·paper·task 자료에서 절차·검증·복구 경로를 skill graph로 증류하고, AREX-Skill Library가 필요한 분기만 research...
Tag
Repo-To-Skill은 DisCo가 repository·paper·task 자료에서 절차·검증·복구 경로를 skill graph로 증류하고, AREX-Skill Library가 필요한 분기만 research...
WikiSkill은 실행 trace·지속적으로 누적되는 wiki·실행 가능한 skill을 분리하고, 실패·성공 경험을 패턴과 수용 이력으로 축적한 뒤 validation gate를 통과한 skill 변경만 반영하...
Skill-Use는 점진적 공개 환경에서 에이전트의 스킬 인식·절차 이행·금지 행동 회피를 분리 측정하는 79개 실전 스킬·177개 sandbox task 기반 벤치마크로, 최강 조합도 SU 0.613에 머문다고...
SkillEvo는 단발 QA 대신 다중 턴 상호작용에서 다음 결함을 드러내고, 사실·구조 거버넌스로 반복 수정의 퇴화를 제어하는 agent skill 진화 프레임워크다.
SkillGate는 장기 에이전트 RL에서 스킬 이름을 고르는 극소수 토큰이 보상 신호를 거의 받지 못하는 selector credit starvation을 진단하고, 선택과 실행의 credit을 분리한 두 채널...
J-Space Cognition Suite V3.6은 모델 가중치를 바꾸지 않고 스킬 문서와 선택형 상태 기록 도구로 장기 작업을 제어하려는 프로젝트다. 구현의 완성도와 공개 벤치마크 주장을 분리해 살펴본다.
SkillZip은 커지는 agent skill library에서 반복되는 절차를 section-level graph와 reversible macro로 압축하되, 입력·출력·의존성·verifier·source ex...
Spark-to-Paper는 코딩 어시스턴트 안에서 13개 스킬을 조합해 아이디어·문헌·실험·그림·LaTeX 조립을 연결하고, 관측되지 않은 결과를 비워 두며 실패한 가설을 종료하는 연구 논문 생성 워크플로를 제...
olelehmann1337/autoresearch-skill은 Claude Code skill을 여러 번 실행하고 binary eval로 점수화한 뒤, 한 번에 하나의 prompt mutation만 keep-or...
arXiv 2607.03451은 에이전트 스킬 최적화를 복잡한 tree merge와 update damping이 아니라, 실패 trace 파일을 읽고 최소 패치를 만든 뒤 독립 validation gate로 ke...
arXiv 2606.32025는 LLM 에이전트가 어떤 스킬을 몇 개, 어떤 순서로 불러올지를 하나의 시퀀스 생성 문제로 정식화하고, 3.9M 학습 파라미터의 작은 컴포저가 검색·전체 SFT 방식보다 안정적인 스...
arXiv 2606.30911은 ML 엔지니어링 에이전트가 과거 Kaggle 경험을 global·domain·competition 스킬로 나눠 재사용할 때, 단순한 flat memory보다 전이 효율이 좋아진다는...
arXiv 2606.16774는 여러 모델의 실행 궤적과 judge 평가를 결합해 전이 가능한 스킬 트리를 만들고, CSRL로 스킬 조건부 rollout을 비교 학습하는 OpenClaw-Skill을 제안한다.
arXiv 2606.05828은 개인 에이전트의 스킬 선택을 LLM의 메모리 프롬프트에 맡기는 대신, 로컬 통계 priors와 좁은 LLM override probe로 분리하는 Local Harness를 제안한다...
COLLEAGUE.SKILL은 동료의 리뷰 기준, 공적 인물의 사고 모델, 민감한 관계 기록을 불투명한 persona prompt가 아니라 inspectable·correctable·governable SKILL...
arXiv 2605.30621은 자기진화 에이전트의 성능 향상을 업데이트 작성 능력과 업데이트 활용 능력으로 분해하고, 실제 병목이 evolver보다 task-solving agent 쪽에 있음을 보여준다.
Google DeepMind의 Science Skills는 Antigravity 위에서 생명과학 데이터베이스, 스크립트, 도메인별 절차를 SKILL.md 단위로 묶어 과학 워크플로의 신뢰도와 토큰 효율을 높이려는...
SkillEvolBench는 180개 과제와 6개 실제 에이전트 환경으로 episodic trajectory가 frozen deployment에서도 쓰이는 procedural skill이 되는지를 분리 측정하는...
uditgoenka/autoresearch는 Karpathy의 autoresearch를 Claude Code, OpenCode, Codex용 skill/command 패키지로 확장해 Goal·Scope·Metri...
Microsoft 등이 공개한 SkillOpt는 에이전트의 자연어 skill 문서를 모델 가중치가 아닌 외부 학습 상태로 보고, rollout·reflection·bounded edit·validation gat...
NVIDIA의 AI-Q agent skill은 Claude Code, Codex, OpenCode 같은 범용 에이전트 하네스가 리서치 파이프라인을 직접 재구현하지 않고, 로컬 또는 사내 AI-Q 서버에 장기 리서...
MMSkills는 SKILL.md 절차에 상태 카드와 시각 keyframe을 결합하고, 런타임에는 branch loading으로 필요한 증거만 검토하게 만드는 시각 에이전트용 멀티모달 스킬 프레임워크다.
Barry Zhang과 Mahesh Murag의 AI Engineer 발표는 Claude Code와 MCP 이후의 에이전트 병목이 연결성이 아니라 도메인 전문성이라고 보고, SKILL.md·스크립트·참조 파일을...
Skills-Coach는 LLM 에이전트 스킬을 자동으로 테스트하고, Training-Free GRPO로 문서와 코드를 다듬고, 원본과 최적화본을 비교 평가하는 self-evolving optimizer 프레임워...
Ctx2Skill은 복잡한 문맥에서 규칙과 절차를 자연어 스킬로 추출해 언어모델의 context learning을 강화하는 self-play 프레임워크로, 인간 주석과 외부 실행 피드백 없이도 closed-sou...