gaotiexinqu

VideoSeeker

gaotiexinqu

VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation

AI 简介

VideoSeeker 是一个面向细粒度视频理解的智能体(agentic)框架,通过原生调用视觉提示驱动的工具(如 view_visual_prompt、crop_video)实现实例级视频分析。其核心特点是将视频理解任务解耦为工具调用决策与视觉-语言协同推理,支持监督微调(SFT)和强化学习(RL)双阶段训练,并在 V2P-Bench 等多基准上验证效果。适用于需要精准定位、裁剪或交互式解析视频中特定对象/事件的研究与应用,如视频内容检索、行为细粒度标注、多模态智能体开发。

Python
122
Stars
7
Forks
3
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分39.71
默认分支main