
ImageWAM
yuyangalin
ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?
AI 简介
ImageWAM 是一种基于图像编辑基础模型构建的世界动作建模框架,旨在验证视频生成是否为世界模型的必要能力,提出仅通过图像编辑即可实现高效动作规划与环境交互。其核心采用 DiT 架构(如 FLUX.2、OmniGen2、Ovis-U1)微调为 ActionDiT,支持在 LIBERO、LIBERO-plus 和 RoboTwin 等机器人仿真基准上进行训练与评估,具备多规模模型变体(1.1B–9B 参数)和统一训练/评估接口。适用于具身智能、机器人任务规划、视觉-动作联合建模等需要轻量级、可解释性较强的动作策略学习场景。
Python
Other123
Stars
5
Forks
57
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分42.33
默认分支main