TsinghuaC3I

ZEDA

TsinghuaC3I

Post-Trained MoE Can Skip Half Experts via Self-Distillation

AI 简介

ZEDA是一个面向已训练完成的静态混合专家(MoE)模型的后训练轻量级优化框架,旨在将其转化为高效动态MoE模型,实现专家计算量降低超50%且精度损失极小。其核心技术包括零输出专家注入、两阶段自蒸馏机制及组级均衡损失,无需重新预训练或微调原始模型参数。适用于大模型推理部署阶段的计算成本压缩场景,尤其适合已在生产环境中部署但需进一步降低服务开销的MoE架构(如Qwen、GLM系列)。

Python
MIT License
38
Stars
3
Forks
30
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分41.81
默认分支main