
AgentHarness
ApodexAI
Evaluation harness for Apodex-1.0 on public deep-research benchmarks.
AI 简介
AgentHarness 是一个面向深度研究场景的开源评估框架,专用于在公开基准(如 BrowseComp、HLE-Text 等)上标准化评测 Apodex-1.0 系列模型。它基于 ReAct 范式构建,支持多语言(含中文)任务评测,提供可复现的推理-验证闭环评估流程,并集成 SGLang 服务部署与结果统计功能。项目采用 Python 实现,强调验证导向的评估设计,适用于大模型研究者对深度推理、信息检索与事实核查能力的系统性测评。
Python
Apache License 2.0344
Stars
35
Forks
2
Watchers
1
Issues
Star 增长
今日0
近 7 天0
近 30 天+37
综合评分48.37
默认分支main