hetolin

PoseVLA

hetolin

Universal Pose Pretraining for Generalizable Vision-Language-Action Policies(RSS2026)

AI 简介

PoseVLA 是一个面向具身智能的通用姿态预训练框架,旨在构建可泛化的视觉-语言-动作(VLA)策略。其核心通过联合预训练视觉语言模型(VLM)与机器人动作建模,支持3D位姿估计(Omni6D/BOP等)和机器人操作动作生成,并创新性地采用共训练(co-training)机制,在同一优化步中交替处理VLM和动作数据;技术上基于HuggingFace生态,兼容DeepSpeed与Hydra,支持多节点分布式训练。适用于机器人仿真评估(如RoboTwin)、跨任务泛化动作策略学习及3D场景理解驱动的具身控制研究。

Python
MIT License
60
Stars
1
Forks
51
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天+4
综合评分41.3
默认分支main