U-OPSD는 모델 자신의 다수결을 teacher context로 바꿔 정답 없...
U-OPSD는 여러 on-policy rollout의 합의를 pseudo-solution으로 만들고, 그 합의와 갈린 trajectory에만 token-level distillation을 적용해 ground tr...
Blog
U-OPSD는 여러 on-policy rollout의 합의를 pseudo-solution으로 만들고, 그 합의와 갈린 trajectory에만 token-level distillation을 적용해 ground tr...
Better Harnesses, Smaller Models는 작은 언어 모델의 실패 trajectory를 진단해 context·tools·agent loop를 자동 적응시키고, 반복 업무에서 frontier LL...
Relevance-Based Embeddings는 query와 item을 소수 support 집합에 대한 heavy-ranker relevance 벡터로 표현하고, CUR 또는 경량 신경 변환으로 별도 embed...
WorldClaw는 자연어 장면 요청을 구조화된 계획, 전역 지형, 지역별 편집 가능한 3D 객체로 분해하고 render-guided refinement로 다시 검증하는 agentic 3D 오픈 월드 생성 프레임...
OneDayAgent는 open-ended everyday task를 bounded subtask, execution memory, global verify/repair로 관리하는 long-horizon harn...
Skill²-Bench와 Skill-Entropy RL은 긴 reasoning chain에서 모델이 앞 단계의 기술을 관성적으로 재사용하지 않고 다음 단계에 맞는 skill로 전환하는 능력을 측정하고 훈련하는 프...
GDPevo는 기업 업무의 숨은 business rule을 train task에 분산하고 held-out test에서 재조합하는 rule hybridization으로, agent의 persistent skill이...
arXiv 2608.05000은 언어·시각 이해·시각 생성을 하나의 모델에 함께 사전학습할 때의 지식 흐름, 용량 경쟁, 조기 통합, 데이터 비율을 통제 실험으로 분해해 실무적인 설계 규칙으로 연결한다.
semantica-agi/semantica는 검색용 벡터 인덱스만으로 남기 쉬운 에이전트의 상태·판단·근거를 context graph, provenance, reasoning, policy 계층으로 묶어 질의 가...
HPD-Parsing은 전체 페이지의 읽기 순서는 layout branch가 조정하고, 블록별 내용은 병렬 branch가 생성하게 해 unified 문서 파서의 긴 autoregressive decoding 병목...
Video-DeepResearch는 프레임 선택과 객체 crop 검색을 먼저 수행하게 한 뒤 웹 탐색을 풀어 주는 단계적 tool policy, SFT+GRPO 학습, 그리고 실제 시각 근거를 요구하는 Video...
Knowledge–Geometry Decoupling(KGD)은 스트리밍 추천에서 행동 지식을 계속 갱신하는 encoder와 task별 ranking geometry를 분리한다. BMTP로 noisy next-i...