MirroS-Lab

HarnessEval-W

MirroS-Lab

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

AI 简介

HarnessEval-W 是一个面向视觉世界模型的智能体化评估框架,旨在为视频生成、世界建模等任务提供可解释、可验证的自动化评测能力。其核心采用分层智能体架构:主智能体动态解析评估意图,分解为物理一致性、因果合理性、状态演化等子问题,并调度专用子智能体结合诊断工具生成带证据链的推理过程,最终形成透明的‘证据树’评估报告。技术上融合了任务感知规划、多智能体协同与可追溯评估机制,支持对 Kling、MiniMax-H3、SEEDance 等主流视频/世界模型进行细粒度诊断。适用于世界模型研发、视频生成系统评测及AI安全可信性验证等需要归因分析的研究与工程场景。

Python
248
Stars
7
Forks
1
Watchers
1
Issues

Star 增长

今日+2
近 7 天+113
近 30 天+113
综合评分73.71
默认分支main