ELDR는 MoE 디코딩 라우팅을 expert locality 문제로 바꾼다
ELDR는 PD-disaggregated MoE 서빙에서 prefill expert signature를 이용해 decode worker를 고르고, active expert union을 줄여 TPOT를 낮추는 vL...
Blog
ELDR는 PD-disaggregated MoE 서빙에서 prefill expert signature를 이용해 decode worker를 고르고, active expert union을 줄여 TPOT를 낮추는 vL...
AMVL은 목표 답을 보는 posterior와 추론 때 쓰는 prior 사이의 answer leakage를 forward/reverse KL로 보정해, Qwen2.5-VL-7B 기반 멀티모달 추론에서 BLINK...
CausalMix는 512개 Qwen2.5-0.5B proxy run에서 데이터 상태, 도메인 비율, downstream 점수를 분리해 SFT 데이터 믹스를 상태별 causal marginal return으로 추...
arXiv 2606.28436의 Dockerless는 Docker 이미지와 테스트 실행 없이 issue·reference patch·candidate patch를 바탕으로 저장소를 읽기 전용 탐색해 패치 정합성을...
BAAI의 Orca는 Next-State Prediction을 중심에 놓고 세계 잠재공간을 학습한 뒤, frozen backbone 위의 텍스트·이미지·행동 readout으로 그 표현이 실제로 쓸모 있는지 검증한...
Neural Procedural Memory는 과거 trajectory의 성공/실패 대비를 steering vector로 압축해, LLM agent의 절차 기억을 텍스트 지시문이 아니라 residual strea...
Agentic Abstention은 WebShop·Terminal-Bench·AbstentionBench를 28K+ 순차 의사결정 과제로 엮어, LLM 에이전트가 불가능한 요청 앞에서 제때 멈추는지 측정한다.
Agents-A1은 Qwen3.5-35B-A3B 기반 35B MoE를 45K 토큰 장기 trajectory, knowledge-action graph, domain-routed on-policy distillat...
Video-MME-Logical은 25개 절차 생성 과제와 중간 상태 진단으로 MLLM이 프레임을 보는 것을 넘어 시간에 따라 상태를 유지·갱신·조합하는지 평가한다.
ViQ는 SigLIP2 기반 시각 표현을 텍스트 정렬·근접 표현 학습·position-aware FSQ로 이산 코드화해, 임의 해상도 이미지 이해와 재구성, VLM 학습 효율을 함께 노리는 visual token...
LMSYS의 Waterfill·LPLB 글은 SGLang/DeepEP MoE inference에서 shared expert와 redundant expert replica를 runtime에 재배치해 EP rank...
Google Research의 Frozen Multi-Token Prediction은 이미 배포된 Gemini Nano v3의 backbone을 고정한 채 MTP head만 붙여 Pixel 9·10의 온디바이스...