Prime Agent는 긴 작업의 성패를 모델 밖 상태 계층으로 옮긴다
Prime Agent는 persistent REPL, recursive subagent, disk-backed Continual Harness를 결합해 long-horizon agent의 문맥·계산·기억을 분리...
Tag
Prime Agent는 persistent REPL, recursive subagent, disk-backed Continual Harness를 결합해 long-horizon agent의 문맥·계산·기억을 분리...
walkinglabs의 Awesome Harness Engineering은 141개 리소스를 컨텍스트·검증·권한·관측성·런타임 같은 여덟 설계면으로 분류해, 모델 밖에서 에이전트 신뢰성을 설계하는 읽기 지도를 제...
AutoDesign은 논문을 포스터로 만드는 개별 agent loop를 넘어, rollout 기록·평가·acceptance gate로 재사용 가능한 DesignHarness 자체를 반복 개선하는 meta-harn...
Skill-Use는 점진적 공개 환경에서 에이전트의 스킬 인식·절차 이행·금지 행동 회피를 분리 측정하는 79개 실전 스킬·177개 sandbox task 기반 벤치마크로, 최강 조합도 SU 0.613에 머문다고...
AI4AI는 강한 builder model이 5% validation set에서 약한 target model용 inference-time harness를 반복 제작·검증하게 해, parameter update 없...
Better Harnesses, Smaller Models는 작은 언어 모델의 실패 trajectory를 진단해 context·tools·agent loop를 자동 적응시키고, 반복 업무에서 frontier LL...
OneDayAgent는 open-ended everyday task를 bounded subtask, execution memory, global verify/repair로 관리하는 long-horizon harn...
arXiv 2607.11423의 ToFu는 3단 context compaction, 검색형 메모리, 다국어 번역 계층, 의존성 인식 swarm을 공개 harness에 묶고 SWE-bench Verified에서 C...
Weco AI의 AIDE² 리포트는 outer loop가 inner research-agent harness를 100회 재작성하고, 고정 비용·비공개 점수·외부 벤치마크로 살아남은 변경만 채택해 인간 수동 튜닝보...
Hugging Face 라이브스트림 ‘Welcome to Open Source AI’는 오픈 모델을 로컬에서 쓰는 법을 llama.cpp, GGUF/quant, llama.app, Inference Provide...
arXiv 2606.14249는 prompt·tool·memory·control flow를 typed harness primitive로 분리하고, AEGIS trace-driven evolution과 cross-...
arXiv 2606.09498은 고정된 LLM 에이전트가 자신의 실행 trace에서 반복 실패를 채굴하고, bounded harness edit을 제안한 뒤, held-in/held-out regression g...
LazyCodex는 npx 한 줄로 OmO의 planning, skills, hooks, model routing, verified completion을 Codex에 설치하는 얇은 배포층이다. 다만 GitHub...
Harness-1은 20B 검색 에이전트가 긴 transcript 위에서 모든 상태를 기억하게 하는 대신, 후보 풀·curated set·검증 기록을 하네스가 관리하게 만든 RL 기반 검색 에이전트다.
arXiv 2605.22166의 Life-Harness는 frozen LLM agent의 반복 실패를 환경 계약, 절차 스킬, 액션 실현, 궤적 제어 계층에서 고치는 runtime harness 방법이다. 7개...
SmallCode는 7B~20B 로컬 모델을 전제로 context budget, forgiving tool parser, patch-first editing, 검증 루프를 묶은 코딩 에이전트다. v0.7.1 릴리...
arXiv survey Code as Agent Harness는 코드가 reasoning·action·state·verification을 묶는 에이전트 운영 기판이 되며, 하네스 인터페이스·메커니즘·멀티에이전트...
Microsoft Security의 MDASH는 100개 이상의 전문 에이전트, 다중 모델 앙상블, debate·dedup·prove 파이프라인으로 Windows 취약점 16건과 CyberGym 88.45% 성과...
Tejas Kumar의 AI Engineer 발표는 낡은 GPT-3.5 Turbo 브라우저 에이전트가 Hacker News upvote task에서 실패하고 거짓 성공을 보고하는 장면을 출발점으로, tool re...
arXiv 2605.15184는 LongMemEval 기반 실험으로 agentic search의 성능이 grep 대 vector만이 아니라 하네스, 도구 출력 전달 방식, 노이즈 스케일링의 결합으로 결정된다는 점...