
SenseNova-Vision
OpenSenseNova
Vision as Unified Multimodal Generation
AI 简介
SenseNova-Vision 是一个将计算机视觉任务统一建模为多模态生成问题的开源模型框架。其核心采用统一多模态模型(UMM)架构,支持通过自然语言指令与可选视觉提示,灵活驱动文本输出(如类别、边界框、OCR、关键点)、图像输出(如分割掩码、深度图、法向量)或图文混合输出,实现检测、分割、深度估计、3D重建等多样化视觉任务的联合建模。技术上强调任务无关的生成式范式、跨任务共享参数与端到端可微训练。适用于需要轻量级统一视觉模型的研究原型开发、多任务联合推理及教育演示场景。
Python
Apache License 2.086
Stars
3
Forks
1
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天+27
综合评分44.51
默认分支master