ROCm

FastFlowLM

ROCm

Run LLMs on AMD Ryzen™ AI NPUs in minutes. Just like Ollama - but purpose-built and deeply optimized for the AMD NPUs.

AI 简介

FastFlowLM 是一个专为 AMD Ryzen™ AI NPU(XDNA2 架构)优化的轻量级大语言模型(LLM)推理运行时。它支持文本、视觉、音频、嵌入及 MoE 模型,上下文长度最高达 256k tokens,安装包仅 17 MB,可在 20 秒内完成部署;无需独立 GPU,功耗降低超 10 倍。项目基于 C++ 实现,深度集成 ROCm 工具链,提供类 Ollama 的简洁 CLI 接口(如 `flm run llama3.2:1b`),并自动拉取 NPU 专用优化模型。适用于在搭载 Strix/Halo/Kraken/Gorgon Point 等 Ryzen AI APU 的 Windows/Linux 设备上进行本地、低功耗、实时 LLM 推理。

C++
1.7k
Stars
137
Forks
25
Watchers
106
Issues

Star 增长

今日0
近 7 天0
近 30 天+8
综合评分52.22
默认分支main