ApodexAI

AgentHarness

ApodexAI

Evaluation harness for Apodex-1.0 on public deep-research benchmarks.

AI 简介

AgentHarness 是一个面向深度研究场景的开源评估框架,专用于在公开基准(如 BrowseComp、HLE-Text 等)上标准化评测 Apodex-1.0 系列模型。它基于 ReAct 范式构建,支持多语言(含中文)任务评测,提供可复现的推理-验证闭环评估流程,并集成 SGLang 服务部署与结果统计功能。项目采用 Python 实现,强调验证导向的评估设计,适用于大模型研究者对深度推理、信息检索与事实核查能力的系统性测评。

Python
Apache License 2.0
344
Stars
35
Forks
2
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天+37
综合评分48.37
默认分支main