alexantaluo0

ACoT-VLA-WM

alexantaluo0

ACOT-VLA-WM is an advanced Vision-Language-Action robotics framework that uses a predictive world model to generate visual subgoals, improving long-horizon robotic manipulation accuracy and robustness.

AI 简介

ACoT-VLA-WM 是一个面向长时序机器人操作的视觉-语言-动作(VLA)框架,通过融合预测性世界模型(Predictive World Model)生成多视角视觉子目标,提升机械臂在高精度、长视野任务中的执行准确率与鲁棒性。其核心技术包括基于BAGEL的世界模型微调、混合子目标采样策略(真实帧与预测帧协同训练),以及端到端的视觉子目标嵌入机制。项目在工业级操作任务(如扫码、精密装配)中实现100%成功率,适用于需要强容错性与物理一致性的机器人仿真训练、真实场景部署及VLA模型研究。

Python
Apache License 2.0
102
Stars
5
Forks
1
Watchers
2
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分42.33
默认分支main