rednote-machine-learning

RedKnot

rednote-machine-learning

Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

AI 简介

RedKnot 是一个面向长上下文大语言模型推理加速的高效服务框架,基于 SGLang 构建,通过头感知的 KV 重用与分段式 PagedAttention 实现性能优化。其核心技术包括:按层-头粒度对 KV 缓存进行四类(global/local/retrieval/dense)分类管理、离线 KV 分段缓存与 RoPE 重定位对齐、基于注意力重要性的弹性稀疏 FFN 计算,以及支持差异化可见窗口的 SegPagedAttention 运行时。在保持近无损精度的前提下,显著降低长文本预填充阶段的计算量(FLOPs 减少 50%–70%)并提升首词生成延迟(TTFT 加速 1.35x–2.2x)。适用于需要处理万级至数十万级 token 上下文的 LLM 在线服务场景,如长文档问答、法律/医疗文本分析及多轮复杂对话系统。

Python
Apache License 2.0
1.6k
Stars
625
Forks
108
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分56.39
默认分支main