MrFlow는 이미지 생성 추론을 저해상도 구조 생성과 1-step 보정으로 가...
MrFlow는 flow-matching 이미지 생성 모델에서 저해상도 샘플링, 픽셀 공간 업스케일, 약한 노이즈 주입, 고해상도 1-step refinement를 묶어 학습 없이 8–10× 추론 가속을 노리는 s...
Blog
MrFlow는 flow-matching 이미지 생성 모델에서 저해상도 샘플링, 픽셀 공간 업스케일, 약한 노이즈 주입, 고해상도 1-step refinement를 묶어 학습 없이 8–10× 추론 가속을 노리는 s...
DeepSeek의 DeepSpec은 DSpark·DFlash·Eagle3 초안 모델을 데이터 준비, 학습, 평가까지 묶어 공개하며, 추측 디코딩을 단순 런타임 옵션이 아니라 재학습 가능한 서빙 스택으로 보여준다.
WorldDirector는 LLM이 3D 객체·카메라 궤적을 계획하고, 이를 2D 위치 조건·appearance binding·causal chunk memory로 내려보내 장기 비디오에서 동적 객체 영속성을 유...
ELDR는 PD-disaggregated MoE 서빙에서 prefill expert signature를 이용해 decode worker를 고르고, active expert union을 줄여 TPOT를 낮추는 vL...
AMVL은 목표 답을 보는 posterior와 추론 때 쓰는 prior 사이의 answer leakage를 forward/reverse KL로 보정해, Qwen2.5-VL-7B 기반 멀티모달 추론에서 BLINK...
CausalMix는 512개 Qwen2.5-0.5B proxy run에서 데이터 상태, 도메인 비율, downstream 점수를 분리해 SFT 데이터 믹스를 상태별 causal marginal return으로 추...
arXiv 2606.28436의 Dockerless는 Docker 이미지와 테스트 실행 없이 issue·reference patch·candidate patch를 바탕으로 저장소를 읽기 전용 탐색해 패치 정합성을...
BAAI의 Orca는 Next-State Prediction을 중심에 놓고 세계 잠재공간을 학습한 뒤, frozen backbone 위의 텍스트·이미지·행동 readout으로 그 표현이 실제로 쓸모 있는지 검증한...
Neural Procedural Memory는 과거 trajectory의 성공/실패 대비를 steering vector로 압축해, LLM agent의 절차 기억을 텍스트 지시문이 아니라 residual strea...
Agentic Abstention은 WebShop·Terminal-Bench·AbstentionBench를 28K+ 순차 의사결정 과제로 엮어, LLM 에이전트가 불가능한 요청 앞에서 제때 멈추는지 측정한다.
Agents-A1은 Qwen3.5-35B-A3B 기반 35B MoE를 45K 토큰 장기 trajectory, knowledge-action graph, domain-routed on-policy distillat...
Video-MME-Logical은 25개 절차 생성 과제와 중간 상태 진단으로 MLLM이 프레임을 보는 것을 넘어 시간에 따라 상태를 유지·갱신·조합하는지 평가한다.