
DiT4DiT
Mondo-Robotics
This is the official code repo for DiT4DiT, a Vision-Action-Model (VAM) framework that combines video generation model with flow-matching-based action prediction for generalizable robotic manipulation.
AI 简介
DiT4DiT是一个面向通用机器人操控的视觉-动作联合建模框架(Vision-Action-Model, VAM),将视频生成扩散Transformer与基于流匹配(flow-matching)的动作预测机制深度融合,支持桌面级抓取与人形机器人全身实时控制。其技术特点是端到端联合建模视频动态演化与动作序列,兼顾泛化性与推理效率,在单策略下完成多任务(如堆叠、抽屉操作、物体重排、家具移动等)。适用于需要跨任务迁移、低延迟响应及视觉引导闭环控制的具身智能场景,尤其适合服务机器人、工业协作机器人等复杂物理交互任务。
Python
MIT License389
Stars
25
Forks
2
Watchers
15
Issues
Star 增长
今日0
近 7 天0
近 30 天+16
综合评分45.84
默认分支main