HumanMLLM

SWIM

HumanMLLM

Official Code for See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding (CVPR 2026)

AI 简介

SWIM是一个面向视频细粒度物体理解的多模态大模型对齐框架,旨在实现自然语言指代表达与视频中特定物体的精准视觉定位与描述。其核心通过注意力级监督机制,在监督微调阶段约束语言模型中实体标记与对应视频区域的注意力关联;采用冻结视觉编码器、仅微调语言模型的高效训练策略,并配套构建了基于自然语言指代的NL-Refer数据集。适用于视频指代理解、细粒度视觉问答、人机协同视频标注等需要高精度跨模态对齐的场景。

Python
96
Stars
0
Forks
88
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分37
默认分支main