agentscope-ai

PawBench

agentscope-ai

A benchmark for evaluating LLM × harness performance.

AI 简介

PawBench 是一个面向具身智能体(Agentic AI)的联合评估基准,专门用于量化大语言模型(LLM)与智能体运行时框架(harness)协同工作的实际性能。其核心功能包括150个覆盖文本、多模态、技能调用与网页交互的细粒度任务,支持9个主流模型与3种典型harness(qwenpaw、openclaw、hermes)的交叉评测,并提供可归因的诊断轨迹、任务切片和公开评分规则。项目强调模型与harness的耦合效应,支持性能归因分析、框架迭代验证与跨系统对比。适用于智能体系统研发、harness架构选型、模型-框架协同优化等研究与工程场景。

Python
Apache License 2.0
84
Stars
6
Forks
52
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+11
综合评分43.64
默认分支main