intel

intel-extension-for-transformers

intel

⚡ Build your chatbot within minutes on your favorite device; offer SOTA compression techniques for LLMs; run LLMs efficiently on Intel Platforms⚡

AI 简介

Intel Extension for Transformers 是一个面向英特尔平台优化的大型语言模型(LLM)推理与压缩工具包。它支持4-bit/INT4权重量化、AutoRound自动量化、QLoRA CPU微调、推测解码(speculative decoding)及StreamingLLM等前沿压缩与加速技术,可在Intel CPU(包括Xeon、Meteor Lake)、GPU(如Data Center GPU Max、Arc A系列)及Habana Gaudi3上高效部署LLM。项目提供开箱即用的聊天机器人(NeuralChat)、RAG检索增强生成、ChatPDF等端到端应用示例,适用于边缘设备、本地工作站及数据中心等资源受限或需国产化硬件适配的LLM落地场景。

Python
Apache License 2.0
2.2k
Stars
216
Forks
4
Watchers
31
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分29.01
默认分支main