qhfan

UniPrefill

qhfan

Implementation of "UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification"

AI 简介

UniPrefill 是一个面向大语言模型长上下文推理的通用预填充加速框架,通过分块动态稀疏化技术在 token 级别直接优化计算,支持全注意力、线性-全混合及滑动窗口-全混合等任意架构。其核心特点是架构无关性、原生兼容连续批处理(continuous batching)、支持张量并行与预填充-解码协同执行,并已深度集成至 vLLM 0.16.0 推理引擎。适用于高并发、长上下文场景下的低延迟服务部署,尤其适合需兼顾吞吐与首字延迟(TTFT)的生产级 LLM 推理系统。

Python
39
Stars
2
Forks
34
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分38.43
默认分支master