harbor-framework

harbor

harbor-framework

Framework for evaluating and improving agents

AI 简介

Harbor 是一个用于评估与优化智能体(agent)和大语言模型的开源框架。它支持在隔离的容器化环境中运行大规模、并行的基准测试(如 Terminal-Bench-2.0、SWE-Bench),提供统一接口对接多种代理(Claude Code、OpenHands 等)、模型及云执行后端(Daytona、Modal)。核心特性包括可扩展的环境抽象、跨平台实验编排、RL rollout 生成及用户自定义基准构建能力。适用于 AI 研究者与工程团队对智能体在终端交互、代码任务等真实场景下的可靠性、鲁棒性与泛化性进行系统性评测与迭代优化。

Python
Apache License 2.0
3k
Stars
1.3k
Forks
17
Watchers
144
Issues

Star 增长

今日0
近 7 天0
近 30 天+259
综合评分71.31
默认分支main