Self-Harness는 에이전트가 자기 하네스를 직접 고치는 실험이다
arXiv 2606.09498은 고정된 LLM 에이전트가 자신의 실행 trace에서 반복 실패를 채굴하고, bounded harness edit을 제안한 뒤, held-in/held-out regression g...
Blog
arXiv 2606.09498은 고정된 LLM 에이전트가 자신의 실행 trace에서 반복 실패를 채굴하고, bounded harness edit을 제안한 뒤, held-in/held-out regression g...
Liquid AI의 LFM2.5-VL-450M-Extract는 450M급 비전-언어 모델을 범용 VQA가 아니라 YAML 스키마 입력과 strict JSON 출력에 맞춘 task-specific Nano로 패키징...
LazyCodex는 npx 한 줄로 OmO의 planning, skills, hooks, model routing, verified completion을 Codex에 설치하는 얇은 배포층이다. 다만 GitHub...
Q00/ouroboros는 막연한 아이디어를 바로 코드로 보내지 않고, 소크라테스식 인터뷰·불변 Seed·3단계 평가·런타임 어댑터를 통해 AI 코딩 작업을 replayable한 실행 계약으로 바꾸려는 speci...
CL-Bench는 여섯 개의 expert-validated stateful environment에서 LLM agent가 과거 interaction을 재사용해 성능 gain을 만드는지 평가하는 continual l...
arXiv 2606.05828은 개인 에이전트의 스킬 선택을 LLM의 메모리 프롬프트에 맡기는 대신, 로컬 통계 priors와 좁은 LLM override probe로 분리하는 Local Harness를 제안한다...
Empromptu AI와 Alchemy는 no-code AI 앱 빌더라는 표면보다, 운영 중인 앱의 사용·수정·평가 데이터를 모아 기업이 소유하는 custom model로 되돌리는 continuous improv...
AppWizzy는 Codex/Gemini CLI가 들어간 전용 클라우드 VM에서 자연어 요청, 코드 수정, 백엔드·DB 실행, 배포·호스팅을 한 환경에 묶어 프로토타입 이후의 운영 공백을 줄이려는 전문형 바이브...
TIDE 논문은 proactive agent가 사용자의 명시 요청을 기다리는 대신, 개인 workspace와 software repository 안에 공존하는 여러 숨은 문제를 반복적으로 찾고 근거와 해결 행동까...
Anthropic Engineering의 Claude containment 글은 claude.ai, Claude Code, Claude Cowork의 서로 다른 격리 구조를 통해 에이전트 보안의 핵심이 행동 감시...
Anthropic Institute의 When AI builds itself는 공개 벤치마크와 내부 데이터를 묶어 AI 개발에서 실행 비용은 급격히 낮아지고, 판단·검증·거버넌스가 새로운 병목으로 떠오른다는 점을...
OpenCV 5는 그래프 기반 DNN 엔진, 80%+ ONNX operator coverage, LLM/VLM 실행, 새 HAL, 0D/1D tensor와 3D 모듈 재편을 통해 전통적 CV 라이브러리를 현대 A...