
skill-eval-harness
adewale
Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters
AI 简介
Skill Eval Harness 是一个用于评估智能体技能(Agent Skill)效果的命令行测试框架。它支持成对变体对比(如启用/禁用技能)、本地确定性断言验证(字符串、正则、JSON字段等)、评测泄漏检测与多轮运行统计,并提供标准化任务生成、输出分级和差异化报告功能。基于 Python 实现,强调评测洁净性(eval hygiene),不依赖特定大模型,可适配 Pi、Claude Code、Jetty 等多种执行器。适用于智能体技能开发中的回归验证、AB 变体对比、评测鲁棒性分析及内部 benchmark 迭代场景。
Python
MIT License62
Stars
5
Forks
51
Watchers
3
Issues
Star 增长
今日0
近 7 天0
近 30 天+8
综合评分43.13
默认分支main