
SDAR
ZJU-REAL
Official code for "Self-Distilled Agentic Reinforcement Learning"
AI 简介
SDAR(Self-Distilled Agentic Reinforcement Learning)是一个面向具身智能体的强化学习框架,旨在提升智能体在复杂任务环境(如ALFWorld、WebShop、Search-QA)中的决策与规划能力。其核心是通过自蒸馏机制将高阶策略知识压缩为轻量级代理模型,并结合多步推理与动作蒸馏实现高效策略优化。技术上支持大语言模型驱动的动作生成、离线策略蒸馏、环境交互式训练及多平台部署。适用于需要长程推理、工具调用与环境交互的具身AI研究场景,如虚拟环境导航、网页交互任务和检索增强问答系统。
Python
Apache License 2.0287
Stars
23
Forks
3
Watchers
4
Issues
Star 增长
今日0
近 7 天0
近 30 天+12
综合评分45.34
默认分支master