비디오 생성 모델은 장면의 외관과 시간적 연속성을 점점 더 그럴듯하게 만들지만, 물체가 가려진 뒤 어디에 다시 나타나는지, 고체 장벽과 충돌할 때 어떻게 움직이는지 같은 기본 물리 제약은 별개의 문제다.
Training Object Permanence in World Models는 이 능력을 물체 영속성(object permanence)과 물체 고체성(object solidity)으로 구체화해 측정하고, 훈련 가능한 데이터로 만드는 연구다.

저자 Hokin Deng은 WROP(World Reasoning with Object Permanence)라는 3D 합성 데이터·평가 체계와, 그 데이터로 사후학습한 16B 비디오 연속 생성 모델 PWM-WROP를 공개한다고 보고한다.
논문의 기여는 단순히 “물리적으로 더 그럴듯한 영상”을 주장하는 데 그치지 않고, 과제 생성기·고정 시험·사람 평가·학습 코드까지 연결하려는 점에 있다.

무엇을 해결하려는가

가려진 물체가 사라지거나, 물체가 벽을 통과하거나, 지지대가 제거된 뒤에도 떠 있는 현상은 시각적 결함이면서 물리적 추론의 실패다.
기존 비디오 모델 평가는 흔히 프롬프트 정합성이나 영상 품질에 집중한다.
이런 점수만으로는 모델이 가려진 물체의 정체성과 위치를 유지했는지, 접촉 사건의 결과를 올바르게 이어갔는지 분리해 보기 어렵다.

WROP는 사람이 직접 설계한 Blender 생성기 150개를 여섯 가지 인지 과제군으로 나눈다.
각 과제는 핵심 물리 구조를 유지하면서 속도, 조명, 카메라 각도 등 주변 조건을 무작위화한다.
그래서 표면적으로 비슷한 클립을 외우는 것보다, 가려짐과 충돌의 규칙을 일반화하는지 시험하는 것을 목표로 한다.

WROP의 물체 영속성·고체성 과제 분류를 나타내는 논문 도식

데이터와 평가 설계

공개된 구성은 150개 생성기, 1.5M 샘플 학습 코퍼스, 300개 문항의 고정 시험이다.
각 클립은 핵심 사건을 기준으로 나뉘며, 모델은 앞부분을 입력으로 받아 사건과 결과가 포함된 뒷부분을 이어 생성한다.
중요한 공개 자료의 단서가 있다.
이 시험은 학습 코퍼스와 독립적으로 분리된 held-out 세트가 아니다.
공식 데이터 카드에 따르면 시험 문항의 일부 ID는 학습 코퍼스와 같은 장면 스크립트와 seed를 공유하고, 생성기 버전과 렌더링 픽셀은 다르지만 아직 별도의 held-out split은 만들어지지 않았다.
따라서 결과는 고정된 역사적 시험에서의 비교로 읽어야 하며, 독립 데이터에 대한 일반화 증거로 보아서는 안 된다.

또 기준 애니메이션은 강체 물리 엔진 시뮬레이션이 아니라 저자가 분석적으로 작성한 keyframe 궤적이다.
장면 규칙과 물리적 타당성은 생성기 설계·검증에 달려 있으므로 “물리적으로 일관된 ground truth”라는 표현도 이 수작업 설계 범위 안에서 이해해야 한다.
학습 데이터 생성기와 시험 생성기는 버전도 다르며(학습 v1.9.1, 시험 v1.2.0 및 일부 패치), 결과 해석에는 이 데이터 계보를 함께 고려해야 한다.

평가의 중심은 VLM 심판이 아니라 사람 평가다.
20명의 평가자가 블라인드 쌍대 비교를 수행했으며, 논문은 총 476건 중 361건이 서로 다른 모델 조합의 판단이었다고 보고한다.
Elo는 프롬프트 정합성, 동작의 자연스러움·물리적 타당성, 물체 영속성 판단을 함께 반영하므로 물체 영속성만을 분리한 점수는 아니다.
사람 평가를 택한 것은 물리 직관의 한계를 공유할 수 있는 VLM 심판에 의존하지 않기 위해서다.
자동 영상 지표도 기준 클립의 픽셀 복사 여부가 아니라 target-fit 보조 진단으로 다룬다.

공개 구성 규모·내용 역할
과제 생성기 Blender 기반 150개, 6개 과제군 인지적으로 정의된 물리 상황 생성
학습 데이터 150만 샘플 물체 영속성·고체성 사후학습
고정 역사적 시험 300문항, 생성기별 2문항 반복 비교용. 학습 코퍼스와 장면 스크립트·seed가 겹치며 held-out이 아님
사람 평가 20명 블라인드 쌍대 비교 연속 생성 결과의 물리적 타당성 판단

공개된 근거에서 확인되는 점

논문은 14개 비디오 모델을 reference-to-video 3개, 편집 7개, 연속 생성 4개로 나누어 비교한다.
PWM-WROP는 연속 생성 모델 가운데 Elo 1위(1679.5)였고, 전체에서는 reference-to-video 두 모델의 1723.6점과 통계적으로 구분되지 않는 결과에 이어 점수상 3위였다.
PWM-WROP의 95% rater-clustered bootstrap 구간은 1603.5~1781.5로 넓다.
이는 확정적인 전체 3위 우위라기보다 점수 순위이며, 사람 평가 비교 수도 제한적이다.
PWM-WROP의 기본 출력 해상도는 320×192로 일부 상용 비교 모델의 720p·1080p보다 낮다.
같은 해상도의 target-fit 비교에서 LPIPS와 MS-SSIM이 가장 좋았다는 결과도 물리 추론 자체를 직접 측정하지는 않는다.

이 결과는 순위를 그대로 일반적 비디오 품질 우위로 확대하면 안 된다.
편집 모델은 입력 클립 구간을 다시 그리는 방식이라 가림 경계 뒤에서 이어지는 사건을 생성하는 연속 생성 모델과 조건이 다르다.
또 PWM-WROP는 WROP 학습을 받은 유일한 모델로, 비교 모델과 아키텍처도 다르며 논문은 Cosmos3-Nano를 한 epoch 미세조정했다.
따라서 성능 차이를 WROP 데이터만의 인과 효과로 돌릴 수 없다.
공개된 시험 응답과 가중치도 학습 corpus와 독립된 held-out 결과라는 뜻은 아니다.

저자는 데이터와 시험, 모델 응답·점수, 가중치, AWS Trainium2용 native-PyTorch 학습 스택을 공개한다고 밝힌다.
즉 단일 모델 성능 발표뿐 아니라 WROP를 후속 모델 비교와 훈련에 재사용할 수 있는 연구 기반으로 제안한다.

실무 관점에서의 해석

WROP의 유용성은 “세계 모델”이라는 포괄적 명칭을 관찰 가능한 물리 능력으로 좁혔다는 데 있다.
영상 생성 연구팀은 물체의 가림·재등장, 충돌·관통, 지지·낙하 같은 실패 양상을 통제된 장면에서 재현하고, 생성기 수준의 변형을 통해 표면 패턴 암기 가능성을 줄여 볼 수 있다.

다만 300문항의 시험은 넓은 현실 물리 이해를 대표하지 않으며, Blender 합성 장면의 규칙과 사람 평가 설계에 결과가 의존한다.
또한 PWM-WROP의 결과는 논문 저자들이 구축한 데이터와 훈련 시스템에 대한 보고이므로, 독립 재현과 다른 생성 환경에서의 전이가 확인되기 전에는 일반적 물리 추론 능력의 증명이라기보다 구체적이고 검증 가능한 연구 단계로 보는 편이 타당하다.

참고 자료