
server
triton-inference-server
The Triton Inference Server provides an optimized cloud and edge inferencing solution.
AI 简介
Triton Inference Server 是一个开源的 AI 模型推理服务框架,用于在云、数据中心和边缘设备上高效部署和运行深度学习与机器学习模型。它支持 TensorRT、PyTorch、ONNX、OpenVINO、Python 等多种框架模型,提供动态批处理、模型流水线(ensemble)、并发推理、GPU/CPU/ASIC(如 Inferentia)异构硬件适配及低延迟实时服务能力。其核心优势在于统一接口抽象、自动模型优化与资源调度,适用于高吞吐在线服务、AI 微服务化部署及边缘智能终端等生产级推理场景。
Python
BSD 3-Clause "New" or "Revised" License10.9k
Stars
1.8k
Forks
144
Watchers
796
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分69.78
默认分支main