opensquilla

claw-swe-bench

opensquilla

Unified adapter framework for evaluating agent harnesses (claws) on SWE-bench

AI 简介

claw-swe-bench 是一个用于统一评估代码类智能体“harness”(即 agent harness,项目中称 claw)在 SWE-bench 基准上的表现的适配框架。它通过标准化提示词、沙箱环境、补丁收集与评估流程,确保不同 harness(如 OpenClaw、Hermes、NanoBot 等)在相同条件下运行,实现可控、可比的横向评测。核心采用 Docker 隔离工作区,支持多语言代码任务(含 SWE-bench Verified 与 Multilingual 子集),并提供 Lite 版本供快速迭代。适用于 AI 编程智能体研发团队对 agent 执行能力、工具调用一致性及代码修复效果的公平基准测试。

Python
MIT License
87
Stars
4
Forks
57
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分42.1
默认分支main