MobileMoE는 MoE를 스마트폰 지연·메모리 문제로 다시 설계한다
MobileMoE는 0.3–0.9B 활성 파라미터의 MoE를 온디바이스 메모리·연산 제약에 맞춰 설계하고, INT4 QAT와 ExecuTorch 커스텀 커널로 실제 스마트폰에서 dense MobileLLM-Pro...
Blog
MobileMoE는 0.3–0.9B 활성 파라미터의 MoE를 온디바이스 메모리·연산 제약에 맞춰 설계하고, INT4 QAT와 ExecuTorch 커스텀 커널로 실제 스마트폰에서 dense MobileLLM-Pro...
TimesFM-3는 목표 시계열·과거 공변량·알려진 미래 공변량을 함께 읽고 시간축 인과 주의와 변수축 전체 주의를 교차시켜, fine-tuning 없이 다변량 예측과 분위수 예측을 한 번의 forward pas...
Tencent WeChat Vision의 WeMM-Embedding은 Qwen3.5 기반 2B·4B·9B 멀티모달 임베딩 모델군으로, 데이터 정제·세밀한 관련도 감독·교차 규모 증류와 Matryoshka 차원 절...
AutoSaddler는 long-horizon agent의 실패 trace를 진단해 prompt·tool·middleware·loop에 구조화된 patch를 적용하고, dev-set generalization g...
D³-MOPD는 multi-teacher on-policy distillation에서 이미 계산되는 도메인별 reverse-KL을 이용해, 빠르게 수렴한 도메인에서 아직 개선 중인 도메인으로 rollout 예산을...
Agent-G²는 장기 에이전트 과제에서 expert trajectory의 prefix를 얼마나 남길지 Gaussian 분포로 샘플링하고, 별도 probe rollout 없이 기존 GRPO rollout 통계만으...
Quantization-Aware Healing은 구조적으로 압축한 4비트 LLM을 원본 teacher에 다시 증류해, 양자화를 손실 단계가 아니라 배포 직전의 두 번째 복구 단계로 바꾼다.
Prime Agent는 persistent REPL, recursive subagent, disk-backed Continual Harness를 결합해 long-horizon agent의 문맥·계산·기억을 분리...
walkinglabs의 Awesome Harness Engineering은 141개 리소스를 컨텍스트·검증·권한·관측성·런타임 같은 여덟 설계면으로 분류해, 모델 밖에서 에이전트 신뢰성을 설계하는 읽기 지도를 제...
AutoDesign은 논문을 포스터로 만드는 개별 agent loop를 넘어, rollout 기록·평가·acceptance gate로 재사용 가능한 DesignHarness 자체를 반복 개선하는 meta-harn...
EviRank는 멀티모달 이미지 질의를 Required·Forbidden·Ignore 제약으로 분해하고, 후보가 각 조건을 충족하는지 검증해 재정렬하는 training-free 접근이다.
Every Coin Has Two Sides는 on-policy distillation이 교사의 문제별 정답보다 reasoning behavior를 전이하며, 같은 계보 teacher에서는 범위를 넓히지만 mul...