WAM
Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models
Dyna-2는 100만 시간의 사람 egocentric 영상으로 world-action model을 학습해, human → robot transfer scaling law를 처음 보여줬다. 아키텍처, 학습·추론 방식, 실험 결과, 그리고 WAM vs VLA 비교를 정리한다.
DiT4DiT: Jointly Modeling Video Dynamics and Actions
DiT4DiT는 Video DiT가 미래를 상상하는 과정의 중간 hidden feature를 꺼내 Action DiT에 넘긴다. 핵심 흐름, 3개의 timestep, 그리고 hidden layer는 누가 정하는지까지 정리한다.
No posts match your search.