weavebench

WeaveBench

weavebench

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

AI 简介

WeaveBench 是一个面向真实运行环境的长周期基准测试框架,专用于评估能协同操作图形界面(GUI)与命令行/代码(CLI/code)的计算机使用智能体。其核心包含114个跨8大工作域(如网页、文档、运维等)的通道不可替代任务,要求智能体在单条执行轨迹中动态交织GUI观察与CLI/code动作;采用轨迹感知的“智能体作为裁判”(Agent-as-Judge)机制,通过回溯完整交互日志与可验证交付物进行防幻觉评分。适用于评估多模态人机交互能力、端到端自动化智能体及混合接口代理系统的研究与开发场景。

Python
MIT License
121
Stars
1
Forks
52
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分40.9
默认分支main