14:05官方账号Decoder@Jonathan KemperMoonshot AI 发布 PerceptionBench 基准,专门测试多模态 AI 模型的视觉感知能力,并将该能力与逻辑推理分离评估。目前没有任何前沿模型在该基准上达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。测试还发现,许多原本被认为是推理过程的错误,实际上在图像读取阶段就已经发生。AI模型PerceptionBenchMoonshot AIGPT-5.6 Sol推荐理由:Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。原文稍后读已读值得跟进有用关注 PerceptionBench
06:30官方一手marktechpost@Sana Hassan本教程介绍如何用Moonshot PerceptionBench搭建多模态视觉模型评估工作流,覆盖OCR、计数、定位、上下文推理、比较、深度理解与幻觉检测等任务。教程使用Colab环境安装依赖,并加载数据集的平衡子集。通过健壮数据加载与自动判定流程,实现端到端评测。教程同时说明如何配置自动评判模块以减少人工干预。技巧PerceptionBenchMoonshot多模态推荐理由:想测自家视觉模型?用Moonshot的PerceptionBench,从OCR到幻觉检测都覆盖,跟着这教程搭流程就行。原文稍后读已读值得跟进有用关注 PerceptionBench