
vllm-ultimate-dgx-spark
AEON-7
AEON vLLM Ultimate — vLLM 0.24.0 built from source for DGX Spark / Blackwell (sm_121a/GB10). One image serves the whole AEON fleet (Gemma-4-26B-A4B, Qwen3.6-27B, Qwen3.6-35B-A3B) with DFlash speculative decoding, NVFP4 weights + Triton NVFP4/FP8 KV cache, high-concurrency DFlash fix, UMA cudagraph clamp, FlashInfer 0.6.12.
AI 简介
AEON vLLM Ultimate 是一个专为 NVIDIA DGX Spark(Blackwell 架构,sm_121a)优化的高性能大语言模型推理容器镜像。它基于 vLLM 0.24.0 源码深度定制,集成 DFlash 推测解码、NVFP4 权重量化、Triton 实现的 NVFP4/FP8 KV 缓存、FlashInfer 0.6.12 后端及多项运行时修复(如 UMA cudagraph 估算钳位、前缀缓存修正等),支持 Gemma-4-26B-A4B、Qwen3.6-27B 和 Qwen3.6-35B-A3B 等多模型统一部署。适用于 Blackwell 平台上的高并发、低延迟 LLM 推理服务场景,尤其适合需兼顾吞吐与显存效率的生产级 AI 推理集群。
Python
64
Stars
7
Forks
52
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分39.71
默认分支main