8月15日
14:05
14:05官方账号Decoder@Jonathan Kemper
Moonshot AI 发布 PerceptionBench 基准,专门测试多模态 AI 模型的视觉感知能力,并将该能力与逻辑推理分离评估。目前没有任何前沿模型在该基准上达到 60% 的准确率,GPT-5.6 Sol 以微弱优势领先。测试还发现,许多原本被认为是推理过程的错误,实际上在图像读取阶段就已经发生。

推荐理由:Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。
8月4日
09:52
09:52官方账号arXiv cs.AI@Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan
现有GRPO等组相对强化学习方法只提供响应级监督,与结构化多目标预测存在粒度失配。MCR-GRPO通过留一比较估计每个预测框的边际贡献,并利用连续匹配集值评估器改进归一化与定位。在REC、DOD、分割和计数基准上,该方法超越了现有GRPO基线。
推荐理由:GRPO以前只看整体得分,现在MCR-GRPO能逐个框算功劳,定位和分割都更准了。
7月20日