
OSCAR
FutureMLS-Lab
OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization
AI 简介
OSCAR 是一种面向大语言模型推理的离线 KV 缓存量化方法,支持 2-bit(INT2)存储以大幅降低内存占用。其核心通过离线分析注意力机制下的键值(K/V)激活协方差结构,计算谱感知旋转矩阵与自适应剪裁阈值,使量化更贴合实际注意力计算路径;结合少量 BF16 缓存与近期窗口保留,实现约 7 倍 KV 缓存压缩,精度损失仅个位数百分点。适用于部署资源受限场景下的长上下文、高并发 LLM 推理服务,尤其兼容 SGLang 框架并提供预校准旋转参数库(RotationZoo)。
Python
540
Stars
76
Forks
39
Watchers
5
Issues
Star 增长
今日0
近 7 天0
近 30 天+3
综合评分46.96
默认分支main