
ACoT-VLA-WM
alexantaluo0
ACOT-VLA-WM is an advanced Vision-Language-Action robotics framework that uses a predictive world model to generate visual subgoals, improving long-horizon robotic manipulation accuracy and robustness.
AI 简介
ACoT-VLA-WM 是一个面向长时序机器人操作的视觉-语言-动作(VLA)框架,通过融合预测性世界模型(Predictive World Model)生成多视角视觉子目标,提升机械臂在高精度、长视野任务中的执行准确率与鲁棒性。其核心技术包括基于BAGEL的世界模型微调、混合子目标采样策略(真实帧与预测帧协同训练),以及端到端的视觉子目标嵌入机制。项目在工业级操作任务(如扫码、精密装配)中实现100%成功率,适用于需要强容错性与物理一致性的机器人仿真训练、真实场景部署及VLA模型研究。
Python
Apache License 2.0102
Stars
5
Forks
1
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分42.33
默认分支main