
cambrian-p
cambrian-mllm
Cambrian-P: Pose-Grounded Video Understanding
AI 简介
Cambrian-P 是一个面向视频理解的多模态大语言模型,通过将人体姿态(pose)作为显式空间-时间锚点,实现对视频内容的细粒度语义解析。其核心功能包括姿态感知的视频问答、动作描述生成与时空推理,技术特点融合了视觉编码器、姿态嵌入模块与大语言模型,支持端到端联合训练。项目提供预训练模型、专用标注数据集(Cambrian-P-Data)及完整训练/评估代码,适用于需要结合人体运动结构理解视频意图的研究场景,如人机交互、行为分析和具身智能中的视觉-语言对齐任务。
Python
Other100
Stars
3
Forks
1
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分41.81
默认分支main