
dflash
z-lab
DFlash: Block Diffusion for Flash Speculative Decoding
AI 简介
DFlash是一个面向大语言模型推理加速的轻量级块扩散(block diffusion)草案模型,专为闪存式推测解码(Flash Speculative Decoding)设计,支持高效、高质量的并行草稿生成。其核心技术特点是采用块级扩散结构,在保持低计算开销的同时提升草案质量与验证通过率,兼容主流开源LLM(如Qwen、Gemma、Llama、Kimi等),可即插即用地集成到现有推理框架中。适用于需要降低延迟、提升吞吐量的大模型在线服务与高并发API部署场景。
Python
5.4k
Stars
386
Forks
43
Watchers
73
Issues
Star 增长
今日0
近 7 天0
近 30 天+163
综合评分70.76
默认分支main