MiaAI-Lab

Qwen3.8-Flash-Next-Single-DGX-Spark

MiaAI-Lab

Qwen3.8-Flash-Next on ONE DGX Spark (TP=1)

AI 简介

该项目提供在单台NVIDIA DGX Spark服务器上高效部署Qwen3.8-Flash-Next视觉语言模型(支持文本、图像与视频多模态输入)的端到端服务方案。基于vLLM推理框架,采用NVFP4量化权重、内存映射PLE表卸载及FP8 KV缓存等技术,在121 GiB统一内存约束下实现超长上下文(262k tokens)低延迟推理。适用于科研机构或企业需在单节点DGX硬件上快速验证多模态大模型能力、进行轻量级API服务或私有化部署的场景。

Python
GNU Affero General Public License v3.0
302
Stars
42
Forks
1
Watchers
21
Issues

Star 增长

今日0
近 7 天0
近 30 天+166
综合评分4.9
默认分支main