chiennv2000

orthrus

chiennv2000

Fast, lossless LLM inference via dual-view diffusion decoding.

AI 简介

Orthrus 是一个面向大语言模型(LLM)的高效无损推理框架,通过双视图扩散解码技术实现并行化 token 生成。其核心结合了自回归模型的精确性与扩散模型的并行加速能力,在保持严格生成保真度的前提下,显著提升推理速度(最高达 7.8×)。项目基于 Qwen3 系列模型构建,支持 FlashAttention 加速和流式输出,适配标准 Hugging Face 接口。适用于对延迟敏感且要求输出完全一致的 LLM 部署场景,如实时对话服务、批量文本生成及资源受限环境下的模型推理。

Python
MIT License
459
Stars
20
Forks
18
Watchers
2
Issues

Star 增长

今日0
近 7 天0
近 30 天+30
综合评分46.97
默认分支main