MoonshotAI

PerceptionBench

MoonshotAI

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

AI 简介

PerceptionBench 是一个面向多模态大语言模型(MLLM)的视觉感知能力细粒度评测基准。它聚焦于10种原子级视觉感知能力(如颜色识别、空间关系判断、计数等),通过3000道答案唯一、语义明确的单能力隔离型问题,排除推理与知识干扰,精准定位模型在底层视觉理解上的薄弱环节;采用统一提示与开源GPT-oss-120B自动评判,支持能力维度横向对比与诊断分析。适用于MLLM研发团队开展模型视觉感知能力评估、缺陷归因及迭代优化。

Python
Apache License 2.0
121
Stars
7
Forks
105
Watchers
0
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分42.71
默认分支master