Kimi给AI做视力表,模型答错或因未看清

Main takeaway: PerceptionBench tests whether multimodal models truly see images. It isolates 10 basic visual skills (counting, localization, OCR, spatial reasoning, etc.) using 3,000 questions drawn from 42 benchmark failures so answers require only image viewing; code and data are released.

币界网消息,OneMillion_AI发文称,月之暗面发布了perceptionbench,旨在检查多模态模型是否真正看清图片。现有评测常将视觉、知识和推理混合,导致模型答错后难以判断是看错还是想错。perceptionbench收集了前沿模型在42个基准中的失败案例,并从中反推出计数、定位、文字识别、空间判断等10项基础视觉能力。团队据此制作了3000道题,每道题只测一项能力,回答时仅需看图,无需推理或外部知识。项目代码和数据集已开放。