
DiffusionOPD
ali-vilab
DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models
AI 简介
DiffusionOPD 是一个面向扩散模型的在线策略蒸馏(On-Policy Distillation)框架,用于高效融合多任务优化目标。其核心是解耦多阶段训练:先独立训练各任务(如美学评分、OCR识别、生成质量评估)的专用教师模型,再通过学生模型自身的去噪轨迹,对齐各教师在对应状态下的输出分布;提出适用于连续扩散过程的闭式每步KL损失,兼容SDE/ODE采样器且方差更低。适用于需协同优化多个下游指标的文本到图像生成场景,尤其适合资源受限下替代多奖励强化学习或级联RL方案。
Python
Apache License 2.0125
Stars
0
Forks
2
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分40
默认分支main