naomili0924

inference_aware_grpo_training

naomili0924

暂无描述

AI 简介

这是一个面向推理效率优化的大语言模型强化学习训练框架,将推理成本(如推测解码接受率、延迟、KV缓存占用等)显式建模为训练奖励信号。项目基于GRPO算法,集成自定义vLLM引擎以实时采集推测解码统计,支持任务正确性与推理效率的联合优化;提供动态难度感知的数据调度器,通过KDE聚类自动分配 rollout 资源。适用于需兼顾生成质量与服务成本的LLM在线部署场景,如高并发API服务、边缘端轻量化推理等。

Python
202
Stars
8
Forks
7
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分36.86
默认分支main