
ViQ
yuxumin
[ECCV2026] ViQ: Text-Aligned Visual Quantized Representations at Any Resolution
AI 简介
ViQ是一个面向多模态学习的视觉离散化表示框架,旨在生成与文本语义对齐、支持任意分辨率输入的量化视觉特征序列。其核心技术结合SigLIP2视觉主干与位置感知的逐头有限标量量化(FSQ)头,兼顾高层语义与细节保真度,输出可直接接入大语言模型(如Qwen2.5)进行理解,或驱动解码器实现高保真图像重建。适用于需要统一文本-视觉离散接口的场景,如多模态大模型训练、跨模态检索、高效视觉编码及生成任务。
Python
Apache License 2.0154
Stars
5
Forks
2
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分42.33
默认分支main