Awesome Harness Engineering은 141개 자료를 에이전트 운...
walkinglabs의 Awesome Harness Engineering은 141개 리소스를 컨텍스트·검증·권한·관측성·런타임 같은 여덟 설계면으로 분류해, 모델 밖에서 에이전트 신뢰성을 설계하는 읽기 지도를 제...
Blog
walkinglabs의 Awesome Harness Engineering은 141개 리소스를 컨텍스트·검증·권한·관측성·런타임 같은 여덟 설계면으로 분류해, 모델 밖에서 에이전트 신뢰성을 설계하는 읽기 지도를 제...
AutoDesign은 논문을 포스터로 만드는 개별 agent loop를 넘어, rollout 기록·평가·acceptance gate로 재사용 가능한 DesignHarness 자체를 반복 개선하는 meta-harn...
EviRank는 멀티모달 이미지 질의를 Required·Forbidden·Ignore 제약으로 분해하고, 후보가 각 조건을 충족하는지 검증해 재정렬하는 training-free 접근이다.
Every Coin Has Two Sides는 on-policy distillation이 교사의 문제별 정답보다 reasoning behavior를 전이하며, 같은 계보 teacher에서는 범위를 넓히지만 mul...
Graph Engineering은 LLM 에이전트 시스템의 task·agent·runtime state 관계를 명시적·동적 그래프로 다뤄, 단일 agent loop를 넘어 system intelligence를 설...
Skill-Use는 점진적 공개 환경에서 에이전트의 스킬 인식·절차 이행·금지 행동 회피를 분리 측정하는 79개 실전 스킬·177개 sandbox task 기반 벤치마크로, 최강 조합도 SU 0.613에 머문다고...
SkillEvo는 단발 QA 대신 다중 턴 상호작용에서 다음 결함을 드러내고, 사실·구조 거버넌스로 반복 수정의 퇴화를 제어하는 agent skill 진화 프레임워크다.
SkillGate는 장기 에이전트 RL에서 스킬 이름을 고르는 극소수 토큰이 보상 신호를 거의 받지 못하는 selector credit starvation을 진단하고, 선택과 실행의 credit을 분리한 두 채널...
Embodied-Navigator는 VLM이 2D 픽셀 waypoint만 고르게 하고, 선택적 추론·압축 메모리·Two-Level GRPO로 장기 시각 언어 내비게이션을 정렬하는 7B 정책이다.
Baidu의 Unlimited-OCR은 DeepSeek-OCR의 압축 encoder 위에 Reference Sliding Window Attention을 얹어, 수십 페이지 문서를 한 번의 디코딩 흐름으로 처리하...
J-Space Cognition Suite V3.6은 모델 가중치를 바꾸지 않고 스킬 문서와 선택형 상태 기록 도구로 장기 작업을 제어하려는 프로젝트다. 구현의 완성도와 공개 벤치마크 주장을 분리해 살펴본다.
Qwen3.8-27B는 27B dense 비전-언어 모델에 기본 thinking, 추론 깊이 제어, 보존형 추론 문맥, 262K 네이티브 컨텍스트와 1M 확장 경로를 묶어 장기 에이전트 작업을 겨냥한 Apache...