
awesome-evals
benchflow-ai
A curated, non-BS library of the best resources for building and evaluating AI agents — papers, blogs, talks, tools, benchmarks. Maintained by BenchFlow.
AI 简介
这是一个面向AI智能体(Agent)构建与评估的高质量资源聚合库,系统性地整理并验证了论文、工具、基准测试、技术博客、演讲视频等核心资料。项目采用深度引用爬取、实践者网络挖掘和人工深度注释相结合的方式,确保每项资源均附带明确的价值说明与可用性验证,并提供可运行的评估模式代码示例(如LLM-as-judge、pass@k、轨迹评分、CI集成等)。适用于AI Agent研发团队、评估框架设计者及大模型应用工程师开展系统性评估体系建设、方法选型与工程落地参考。
Other
794
Stars
79
Forks
2
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天+90
综合评分58.71
默认分支main