DocOps는 문서 에이전트를 ‘파일이 열리는가’가 아니라 ‘원본 상태를 보존했...
DocOps는 XLSX·DOCX·PPTX·PDF의 native state를 직접 검사하는 deterministic verifier와 210개 Harbor task로, 문서 에이전트의 장기 상태 추적·의미 검증·비...
Blog
DocOps는 XLSX·DOCX·PPTX·PDF의 native state를 직접 검사하는 deterministic verifier와 210개 Harbor task로, 문서 에이전트의 장기 상태 추적·의미 검증·비...
TimeLens2는 long video의 단일·반복·질문형·egocentric 근거 구간을 하나의 generative interface로 찾고, 검증된 93K supervision과 temporal Wassers...
KeyFrame-Compass는 386개 기본 샘플과 키프레임 실행·전체 비디오 품질을 분리한 진단 지표로, 멀티 키프레임 비디오 생성이 자연스러움과 제어 충실도 사이에서 어떤 trade-off를 보이는지 측정하...
arXiv 2607.14777의 SEED는 완료된 on-policy trajectory에서 hindsight skill을 만들고, 같은 행동을 skill 유무 두 문맥에서 재채점해 GRPO에 dense token...
arXiv 2607.13104는 자기개선 에이전트를 foundation model 업데이트와 prompt·memory·tool·control logic을 고치는 scaffold 업데이트로 나누고, 성능보다 tra...
arXiv 2607.11423의 ToFu는 3단 context compaction, 검색형 메모리, 다국어 번역 계층, 의존성 인식 swarm을 공개 harness에 묶고 SWE-bench Verified에서 C...
WebSwarm은 검색 중 발견한 증거에 따라 agent node와 search mode를 계속 생성·수정하는 재귀적 orchestration으로, 깊은 추론과 넓은 정보 수집을 같은 실행 흐름에서 결합하려는 웹...
Weco AI의 AIDE² 리포트는 outer loop가 inner research-agent harness를 100회 재작성하고, 고정 비용·비공개 점수·외부 벤치마크로 살아남은 변경만 채택해 인간 수동 튜닝보...
olelehmann1337/autoresearch-skill은 Claude Code skill을 여러 번 실행하고 binary eval로 점수화한 뒤, 한 번에 하나의 prompt mutation만 keep-or...
Direct-OPD는 작은 RL teacher의 최종 정책을 모방하지 않고, 사전·사후 체크포인트의 로그비에 남은 policy shift를 큰 student의 온폴리시 학습용 dense reward로 바꿔 wea...
StudioRecon은 저중첩 다중 카메라 영상에서 배경에는 비디오 확산 prior를, 사람에는 SMPL 기하 prior를 따로 적용해 4D Gaussian human-scene을 재구성하고, 시간 일관성 보정으...
arXiv 2607.03451은 에이전트 스킬 최적화를 복잡한 tree merge와 update damping이 아니라, 실패 trace 파일을 읽고 최소 패치를 만든 뒤 독립 validation gate로 ke...