Orca는 다음 토큰이 아니라 다음 ‘세계 상태’를 예측하려 한다
BAAI의 Orca는 Next-State Prediction을 중심에 놓고 세계 잠재공간을 학습한 뒤, frozen backbone 위의 텍스트·이미지·행동 readout으로 그 표현이 실제로 쓸모 있는지 검증한...
Blog
BAAI의 Orca는 Next-State Prediction을 중심에 놓고 세계 잠재공간을 학습한 뒤, frozen backbone 위의 텍스트·이미지·행동 readout으로 그 표현이 실제로 쓸모 있는지 검증한...
Neural Procedural Memory는 과거 trajectory의 성공/실패 대비를 steering vector로 압축해, LLM agent의 절차 기억을 텍스트 지시문이 아니라 residual strea...
Agentic Abstention은 WebShop·Terminal-Bench·AbstentionBench를 28K+ 순차 의사결정 과제로 엮어, LLM 에이전트가 불가능한 요청 앞에서 제때 멈추는지 측정한다.
Agents-A1은 Qwen3.5-35B-A3B 기반 35B MoE를 45K 토큰 장기 trajectory, knowledge-action graph, domain-routed on-policy distillat...
Video-MME-Logical은 25개 절차 생성 과제와 중간 상태 진단으로 MLLM이 프레임을 보는 것을 넘어 시간에 따라 상태를 유지·갱신·조합하는지 평가한다.
ViQ는 SigLIP2 기반 시각 표현을 텍스트 정렬·근접 표현 학습·position-aware FSQ로 이산 코드화해, 임의 해상도 이미지 이해와 재구성, VLM 학습 효율을 함께 노리는 visual token...
LMSYS의 Waterfill·LPLB 글은 SGLang/DeepEP MoE inference에서 shared expert와 redundant expert replica를 runtime에 재배치해 EP rank...
Google Research의 Frozen Multi-Token Prediction은 이미 배포된 Gemini Nano v3의 backbone을 고정한 채 MTP head만 붙여 Pixel 9·10의 온디바이스...
Neo4j Labs의 LLM Graph Builder를 저장소·문서·릴리스 기준으로 살펴본다. 핵심은 문서 chunk와 entity graph를 함께 만들고, 이를 Neo4j 안에서 시각화·GraphRAG·평가까...
Hyper-Extract는 문서를 리스트·Pydantic 모델·지식 그래프·하이퍼그래프·시공간 그래프로 추출하고, CLI·Python SDK·MCP·Obsidian export까지 붙인 지식 추출 프레임워크다.
Hugging Face 라이브스트림 ‘Welcome to Open Source AI’는 오픈 모델을 로컬에서 쓰는 법을 llama.cpp, GGUF/quant, llama.app, Inference Provide...
ShutterMuse는 사후 크롭이 아니라 촬영 중 구도 결정, 프레이밍 보정, 피사체 포즈 추천을 함께 다루기 위해 CaptureGuide-Bench와 130K 규모 CaptureGuide-Dataset을 제안...