huawei-csl

KVarN

huawei-csl

KVarN is a native vLLM KV-cache quantization backend for your agents: 3-5x more context, throughput above FP16, and FP16-level accuracy. Calibration-free, one flag.

AI 简介

KVarN 是一个面向大语言模型推理的 KV 缓存量化后端,专为 vLLM 框架深度优化。其核心功能是在不牺牲精度和吞吐量的前提下,将 KV 缓存容量提升 3–5 倍;采用方差归一化量化策略,支持免校准、单标志启用(如 kv_cache_dtype="kvarn_k4v2_g128"),且完全兼容原生 vLLM 接口,无需修改模型或训练流程。技术上基于 Triton 实现 JIT 编译内核,运行时自动优化,实测在 Qwen3-32B 等长上下文场景下达到 FP16 级精度与更高吞吐。适用于需处理超长上下文(如 16K+)、高并发 Agent 服务及资源受限环境下的 LLM 在线推理部署。

Python
Apache License 2.0
452
Stars
32
Forks
5
Watchers
7
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分4.56
默认分支main