aa2448208027-code

LocalAIHotSwap

aa2448208027-code

Local llama.cpp model hot-swap controller for preserving chat context with low VRAM overhead

AI 简介

LocalAIHotSwap 是一个为 llama.cpp 提供模型热切换能力的轻量级代理控制器,支持在不中断对话上下文的前提下动态更换本地 GGUF 模型。其核心功能包括:通过 llama-server 的 /models/load 和 /models/unload 接口管理模型生命周期;保持预设 prompt 和历史消息跨模型持久;采用 zero_overlap 切换策略以最小化 VRAM 峰值占用;提供 OpenAI 兼容的 /v1/chat/completions 接口及 SSE 流式响应。适用于本地多模型实验、低显存设备(如消费级 GPU)上的交互式 AI 应用开发与快速迭代场景。

Python
94
Stars
2
Forks
1
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分38.43
默认分支main