Pi series
π₀.₇ - Steerable Generalist Robot Foundation Model
VLA에 무엇을 할지뿐 아니라 어떻게 할지까지 prompt로 알려주면, 품질이 제각각인 data도 다 먹일 수 있을까? π₀.₇의 metadata·subgoal image prompting과 compositional generalization을 정리했다.
π₀.₆ - RECAP (π*₀.₆) + MEM
π₀.₆ 위에 올라간 두 논문을 같이 정리했다. RECAP은 경험으로 행동을 얼마나 잘 하게 만들고, MEM은 시간에 걸친 맥락을 어떻게 기억하게 만들까?
π₀.₅ + Knowledge Insulation
VLM에 팔다리(action)를 붙이면서 원래 갖고 있던 언어·시각 능력은 잃지 않을 수 있을까? Knowledge Insulation이 stop-gradient 하나로 이걸 어떻게 해결하는지 정리했다.
π₀.₅ - VLA with Open-World Generalization
한 번도 본 적 없는 집에 로봇을 갖다 놓아도 정리를 할 수 있을까? π₀.₅가 FAST token 학습과 Flow Matching Action Expert, high-level subtask 예측을 어떻게 한 모델에 묶었는지 정리했다.
π₀-FAST - Efficient Action Tokenization
고주파 robot action을 autoregressive VLA는 왜 잘 못 배울까? FAST가 DCT와 BPE로 action을 어떻게 압축했는지, 그리고 실험이 무엇을 검증했는지 논문 순서대로 정리했다.
π₀ - Vision-Language-Action Flow Model
π₀는 PaliGemma VLM에 Action Expert를 어떻게 붙였고, Gaussian noise에서 continuous action chunk를 어떻게 만들어낼까? attention mask, flow matching, loss function을 하나씩 짚어봤다.
No posts match your search.