
semantic-wm
chandar-lab
repository for training action-conditioned latent diffusion world models for robot video generation
AI 简介
该项目实现了一种面向机器人任务的语义感知型潜在扩散世界模型(Semantic World Model),用于生成动作条件下的机器人视频并评估策略。核心功能包括支持多种视觉编码器(如V-JEPA、SigLIP、DINOv2等)、语义适配器(S-VAE)压缩高维特征至紧凑扩散空间、轻量级像素解码器,以及多目标训练(Flow Matching/DDPM)和多视角建模能力。其技术特点是强调语义一致性而非像素保真度,在动作理解、任务进度建模与下游策略泛化方面优于传统重建式潜空间。适用于具身智能、机器人仿真训练、视觉-动作联合建模等研究场景。
Python
70
Stars
2
Forks
52
Watchers
3
Issues
Star 增长
今日0
近 7 天0
近 30 天+3
综合评分38.73
默认分支main