TiezMind

Visual-OPSD

TiezMind

[arxiv 2606] Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

AI 简介

Visual-OPSD 是一个面向统一多模态模型的跨模态在线策略自蒸馏框架,旨在将视觉生成能力(如中间视觉思维图像)的知识高效迁移至纯文本理解路径,从而在不牺牲推理精度的前提下显著降低延迟。其核心技术包括跨模态策略对齐、无需显式视觉生成的自蒸馏训练机制,以及对冻结教师模型的轻量级学生网络微调。适用于需兼顾空间推理能力与低延迟要求的多模态AI部署场景,如实时视觉问答、边缘端多模态理解等。

Python
Apache License 2.0
55
Stars
0
Forks
51
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分40
默认分支main