ReferTrack은 ‘누구’를 먼저 가리킨 뒤 ‘어디로’ 갈지 결정한다
ReferTrack은 자연어로 지정된 보행자를 indexed bounding box 중 하나로 먼저 고르는 Refer-CoT와, 선택한 box의 시간적 궤적을 보존하는 TVBI memory를 결합해 단일 전방 카...
Tag
ReferTrack은 자연어로 지정된 보행자를 indexed bounding box 중 하나로 먼저 고르는 Refer-CoT와, 선택한 box의 시간적 궤적을 보존하는 TVBI memory를 결합해 단일 전방 카...
BAAI의 Orca는 Next-State Prediction을 중심에 놓고 세계 잠재공간을 학습한 뒤, frozen backbone 위의 텍스트·이미지·행동 readout으로 그 표현이 실제로 쓸모 있는지 검증한...
Rethinking VLM Representation for VLA Initialization은 로봇 VLA 성능을 단순한 백본 크기 문제가 아니라 embodied VQA 신호, LoRA 보존, 로봇 데이터 사전...
PriorVLA는 pretrained VLA를 단순 초기값으로 쓰지 않고, frozen Prior Expert와 Expert Queries로 장면·모터 priors를 보존해 OOD와 few-shot 로봇 조작 적...
LiteVLA-H는 Jetson AGX Orin 위의 256M VLA에서 pre-fill이 액션 지연의 대부분을 차지한다는 관찰을 바탕으로, 빠른 외부 guidance 루프와 느린 semantic percepti...