Repo-To-Skill은 GitHub 저장소를 실행 가능한 연구 에이전트 지식으로 바꾼다
Repo-To-Skill은 DisCo가 repository·paper·task 자료에서 절차·검증·복구 경로를 skill graph로 증류하고, AREX-Skill Library가 필요한 분기만 research agent에 로드하는 운영 지식 계층을 제안한다.
Blog
Repo-To-Skill은 DisCo가 repository·paper·task 자료에서 절차·검증·복구 경로를 skill graph로 증류하고, AREX-Skill Library가 필요한 분기만 research agent에 로드하는 운영 지식 계층을 제안한다.
H Company의 NeoMME는 텍스트 토큰과 원본 이미지 패치를 하나의 양방향 Transformer로 처리하고, dense·late-interaction 검색 표현을 한 번에 내보내며 시각 문서 RAG의 모델...
Harness-of-Harness는 planner·developer·QA tester를 artifact와 evidence로 연결해, coding agent가 여러 iteration에 걸쳐 계획·구현·검증을 누적하...
Skaling은 모델 크기와 학습 토큰 수가 독립적으로 loss를 낮춘다는 Chinchilla의 가정을 하나의 결합 지수로 완화하고, 저비용 L-shape 격자만으로 대규모 학습 구간의 loss를 예측하려는 스케...
WikiSkill은 실행 trace·지속적으로 누적되는 wiki·실행 가능한 skill을 분리하고, 실패·성공 경험을 패턴과 수용 이력으로 축적한 뒤 validation gate를 통과한 skill 변경만 반영하...
MobileMoE는 0.3–0.9B 활성 파라미터의 MoE를 온디바이스 메모리·연산 제약에 맞춰 설계하고, INT4 QAT와 ExecuTorch 커스텀 커널로 실제 스마트폰에서 dense MobileLLM-Pro...
TimesFM-3는 목표 시계열·과거 공변량·알려진 미래 공변량을 함께 읽고 시간축 인과 주의와 변수축 전체 주의를 교차시켜, fine-tuning 없이 다변량 예측과 분위수 예측을 한 번의 forward pas...
Tencent WeChat Vision의 WeMM-Embedding은 Qwen3.5 기반 2B·4B·9B 멀티모달 임베딩 모델군으로, 데이터 정제·세밀한 관련도 감독·교차 규모 증류와 Matryoshka 차원 절...
AutoSaddler는 long-horizon agent의 실패 trace를 진단해 prompt·tool·middleware·loop에 구조화된 patch를 적용하고, dev-set generalization g...
D³-MOPD는 multi-teacher on-policy distillation에서 이미 계산되는 도메인별 reverse-KL을 이용해, 빠르게 수렴한 도메인에서 아직 개선 중인 도메인으로 rollout 예산을...
Agent-G²는 장기 에이전트 과제에서 expert trajectory의 prefix를 얼마나 남길지 Gaussian 분포로 샘플링하고, 별도 probe rollout 없이 기존 GRPO rollout 통계만으...
Quantization-Aware Healing은 구조적으로 압축한 4비트 LLM을 원본 teacher에 다시 증류해, 양자화를 손실 단계가 아니라 배포 직전의 두 번째 복구 단계로 바꾼다.
Prime Agent는 persistent REPL, recursive subagent, disk-backed Continual Harness를 결합해 long-horizon agent의 문맥·계산·기억을 분리...