그래프 엔지니어링은 에이전트를 더 붙이는 대신, 관계를 운영 대상으로 만든다
Graph Engineering은 LLM 에이전트 시스템의 task·agent·runtime state 관계를 명시적·동적 그래프로 다뤄, 단일 agent loop를 넘어 system intelligence를 설...
Blog
Graph Engineering은 LLM 에이전트 시스템의 task·agent·runtime state 관계를 명시적·동적 그래프로 다뤄, 단일 agent loop를 넘어 system intelligence를 설...
Skill-Use는 점진적 공개 환경에서 에이전트의 스킬 인식·절차 이행·금지 행동 회피를 분리 측정하는 79개 실전 스킬·177개 sandbox task 기반 벤치마크로, 최강 조합도 SU 0.613에 머문다고...
SkillEvo는 단발 QA 대신 다중 턴 상호작용에서 다음 결함을 드러내고, 사실·구조 거버넌스로 반복 수정의 퇴화를 제어하는 agent skill 진화 프레임워크다.
SkillGate는 장기 에이전트 RL에서 스킬 이름을 고르는 극소수 토큰이 보상 신호를 거의 받지 못하는 selector credit starvation을 진단하고, 선택과 실행의 credit을 분리한 두 채널...
Embodied-Navigator는 VLM이 2D 픽셀 waypoint만 고르게 하고, 선택적 추론·압축 메모리·Two-Level GRPO로 장기 시각 언어 내비게이션을 정렬하는 7B 정책이다.
Baidu의 Unlimited-OCR은 DeepSeek-OCR의 압축 encoder 위에 Reference Sliding Window Attention을 얹어, 수십 페이지 문서를 한 번의 디코딩 흐름으로 처리하...
J-Space Cognition Suite V3.6은 모델 가중치를 바꾸지 않고 스킬 문서와 선택형 상태 기록 도구로 장기 작업을 제어하려는 프로젝트다. 구현의 완성도와 공개 벤치마크 주장을 분리해 살펴본다.
Qwen3.8-27B는 27B dense 비전-언어 모델에 기본 thinking, 추론 깊이 제어, 보존형 추론 문맥, 262K 네이티브 컨텍스트와 1M 확장 경로를 묶어 장기 에이전트 작업을 겨냥한 Apache...
AI4AI는 강한 builder model이 5% validation set에서 약한 target model용 inference-time harness를 반복 제작·검증하게 해, parameter update 없...
SkillZip은 커지는 agent skill library에서 반복되는 절차를 section-level graph와 reversible macro로 압축하되, 입력·출력·의존성·verifier·source ex...
Spark-to-Paper는 코딩 어시스턴트 안에서 13개 스킬을 조합해 아이디어·문헌·실험·그림·LaTeX 조립을 연결하고, 관측되지 않은 결과를 비워 두며 실패한 가설을 종료하는 연구 논문 생성 워크플로를 제...
Motif 3는 314B total·13.2B activated MoE, 256K context, GDLA와 MOPD를 결합해 큰 희소 모델의 용량을 도구 사용·코드·장문 추론 전문성으로 통합하려는 공개 모델 릴...