Robbyant

lingbot-va

Robbyant

[RSS 2026] Causal video-action world model for generalist robot control

AI 简介

LingBot-VA 是一个面向通用机器人控制的因果视频-动作世界模型,旨在联合建模视觉动态演化与动作决策过程。其核心采用自回归(AR)扩散框架与双流混合专家Transformer(MoT)架构,支持异步执行与KV缓存优化,在保持视频预测与动作生成概念分离的同时实现高效长时序建模。项目在RoboTwin-2.0和LIBERO等标准仿真基准上验证了高样本效率、强跨场景泛化能力及长程任务成功率,适用于具身智能研究、机器人仿真训练、端到端视觉-动作策略学习等场景。

Python
Apache License 2.0
1.4k
Stars
126
Forks
12
Watchers
55
Issues

Star 增长

今日0
近 7 天0
近 30 天+59
综合评分60.21
默认分支main