AutoSaddler는 실패 trace를 읽고 agent harness를 지속적...
AutoSaddler는 long-horizon agent의 실패 trace를 진단해 prompt·tool·middleware·loop에 구조화된 patch를 적용하고, dev-set generalization g...
Tag
AutoSaddler는 long-horizon agent의 실패 trace를 진단해 prompt·tool·middleware·loop에 구조화된 patch를 적용하고, dev-set generalization g...
Agent-G²는 장기 에이전트 과제에서 expert trajectory의 prefix를 얼마나 남길지 Gaussian 분포로 샘플링하고, 별도 probe rollout 없이 기존 GRPO rollout 통계만으...
Prime Agent는 persistent REPL, recursive subagent, disk-backed Continual Harness를 결합해 long-horizon agent의 문맥·계산·기억을 분리...
AutoDesign은 논문을 포스터로 만드는 개별 agent loop를 넘어, rollout 기록·평가·acceptance gate로 재사용 가능한 DesignHarness 자체를 반복 개선하는 meta-harn...
J-Space Cognition Suite V3.6은 모델 가중치를 바꾸지 않고 스킬 문서와 선택형 상태 기록 도구로 장기 작업을 제어하려는 프로젝트다. 구현의 완성도와 공개 벤치마크 주장을 분리해 살펴본다.
OneDayAgent는 open-ended everyday task를 bounded subtask, execution memory, global verify/repair로 관리하는 long-horizon harn...
BAAI의 AREX는 provisional answer를 제약별로 감사해 accept·refine·restart를 고르고, 검증된 근거와 미해결 조건만 남기는 autonomous context update로 긴...
arXiv 2607.14777의 SEED는 완료된 on-policy trajectory에서 hindsight skill을 만들고, 같은 행동을 skill 유무 두 문맥에서 재채점해 GRPO에 dense token...
Agents-A1은 Qwen3.5-35B-A3B 기반 35B MoE를 45K 토큰 장기 trajectory, knowledge-action graph, domain-routed on-policy distillat...
AutoLab은 36개 실행형 연구·엔지니어링 최적화 과제로 frontier 모델이 반복 측정·수정·시간 관리까지 해낼 수 있는지 묻는 장시간 에이전트 벤치마크다.
Qwen3.7-Max는 코딩 에이전트, MCP 기반 업무 자동화, 장시간 자율 실행, cross-harness 일반화를 전면에 내세운 Qwen의 최신 독점형 agent foundation model이다.