canwhite

AgentEval

canwhite

The agent responsible for conducting the agent evaluation

AI 简介

AgentEval 是一个面向 LLM 智能体(Agent)的自动化评测工具,通过透明 HTTP 代理捕获 Agent 与 LLM API 的交互流量,实现会话自动切分、结构化视图构建、多维评分(规则+LLM 判定)、行为问题诊断(10 条规则引擎+LLM 总结)及配置根因探针(LLM 审查 prompt/skills/tools)。基于 Rust 构建,内置 Web 仪表盘,支持本地快速部署。适用于 AI 工程师在开发、调试和迭代 LLM 智能体时进行可复现、可解释的端到端质量评估。

Rust
407
Stars
5
Forks
1
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天+91
综合评分48.43
默认分支main