
APPO
AMAP-ML
暂无描述
AI 简介
APPO(Agentic Procedural Policy Optimization)是一种面向工具调用型推理智能体的强化学习训练方法,通过在程序化决策点进行过程感知的分支采样与信用回溯,提升代理在复杂任务链中的策略稳定性与泛化能力。其核心技术包括基于熵与未来价值加权的分支评分机制、复用工具循环的分支续写、以及仅对初始轨迹token优化的actor损失设计。项目构建于ARPO框架之上,支持冷启动监督微调、RL训练与多阶段评估,适用于需要多步工具协同与结构化流程控制的智能体场景,如自动化API编排、复杂问题求解与可解释性增强的决策系统。
Python
69
Stars
1
Forks
1
Watchers
2
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分34.9
默认分支main