AutoTrustAI

PaperGuru-Benchmark

AutoTrustAI

Lifecycle-Aware Memory for long-horizon LLM agents — 66.05% on PaperBench, 94.66% on SurveyBench, 10 peer-reviewed acceptances at FSE/ICML/TOSEM/AEI/ICoGB

AI 简介

PaperGuru-Benchmark 是一个面向长周期LLM智能体的生命周期感知记忆(LAM)评测基准框架,旨在系统性评估长期记忆机制在科研文献理解与综述生成任务中的有效性。其核心是基于四公理形式化定义的Lifecycle-Aware Memory(LAM)范式,提供可复现的PaperBench与SurveyBench两大评测协议,支持对记忆持久性、信息衰减建模、时序上下文保持等关键能力的量化评估。项目已通过FSE、ICML等顶会实证验证,适用于AI for Science、学术智能助手、长程研究代理等需跨文档、跨阶段知识管理的场景。

TeX
Other
1.3k
Stars
197
Forks
128
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天+35
综合评分58.39
默认分支main