
PerceptionBench
MoonshotAI
PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models
AI 简介
PerceptionBench 是一个面向多模态大语言模型(MLLM)的视觉感知能力细粒度评测基准。它聚焦于10种原子级视觉感知能力(如颜色识别、空间关系判断、计数等),通过3000道答案唯一、语义明确的单能力隔离型问题,排除推理与知识干扰,精准定位模型在底层视觉理解上的薄弱环节;采用统一提示与开源GPT-oss-120B自动评判,支持能力维度横向对比与诊断分析。适用于MLLM研发团队开展模型视觉感知能力评估、缺陷归因及迭代优化。
Python
Apache License 2.0121
Stars
7
Forks
105
Watchers
0
Issues
Star 增长
今日0
近 7 天0
近 30 天0
综合评分42.71
默认分支master