VCSD는 ‘검은 이미지와의 차이’로 VLM self-distillation을...
Visual Contrastive Self-Distillation(VCSD)은 EMA teacher가 원본 이미지와 content-erased control에서 낸 token distribution의 차이를 이용...
Blog
Visual Contrastive Self-Distillation(VCSD)은 EMA teacher가 원본 이미지와 content-erased control에서 낸 token distribution의 차이를 이용...
ReferTrack은 자연어로 지정된 보행자를 indexed bounding box 중 하나로 먼저 고르는 Refer-CoT와, 선택한 box의 시간적 궤적을 보존하는 TVBI memory를 결합해 단일 전방 카...
BAAI의 AREX는 provisional answer를 제약별로 감사해 accept·refine·restart를 고르고, 검증된 근거와 미해결 조건만 남기는 autonomous context update로 긴...
Sionic은 B300에서 753B MoE GLM-5.2의 batch-1 생성을 600~1000 tok/s로 끌어올렸다고 보고한다. 핵심은 SASS·TMEM 기반 커널, live FP8 quantization,...
DocOps는 XLSX·DOCX·PPTX·PDF의 native state를 직접 검사하는 deterministic verifier와 210개 Harbor task로, 문서 에이전트의 장기 상태 추적·의미 검증·비...
TimeLens2는 long video의 단일·반복·질문형·egocentric 근거 구간을 하나의 generative interface로 찾고, 검증된 93K supervision과 temporal Wassers...
KeyFrame-Compass는 386개 기본 샘플과 키프레임 실행·전체 비디오 품질을 분리한 진단 지표로, 멀티 키프레임 비디오 생성이 자연스러움과 제어 충실도 사이에서 어떤 trade-off를 보이는지 측정하...
arXiv 2607.14777의 SEED는 완료된 on-policy trajectory에서 hindsight skill을 만들고, 같은 행동을 skill 유무 두 문맥에서 재채점해 GRPO에 dense token...
arXiv 2607.13104는 자기개선 에이전트를 foundation model 업데이트와 prompt·memory·tool·control logic을 고치는 scaffold 업데이트로 나누고, 성능보다 tra...
arXiv 2607.11423의 ToFu는 3단 context compaction, 검색형 메모리, 다국어 번역 계층, 의존성 인식 swarm을 공개 harness에 묶고 SWE-bench Verified에서 C...
WebSwarm은 검색 중 발견한 증거에 따라 agent node와 search mode를 계속 생성·수정하는 재귀적 orchestration으로, 깊은 추론과 넓은 정보 수집을 같은 실행 흐름에서 결합하려는 웹...
Weco AI의 AIDE² 리포트는 outer loop가 inner research-agent harness를 100회 재작성하고, 고정 비용·비공개 점수·외부 벤치마크로 살아남은 변경만 채택해 인간 수동 튜닝보...