10:00Viking@vikingmute网友发现了一个名为Sophon.at的AI信息聚合网站,它收集并展示了AI领域的论文、最新模型、Benchmark和排行榜,论文还支持在线直接阅读。网站还提供Feed订阅功能,方便用户追踪最新动态。Sophon一词源自《三体》中的智子,寓意智能与监控。该网站因其全面性和易用性受到关注,适合AI研究者和爱好者使用。AI产品AI聚合论文模型推荐理由:做AI研究或追踪前沿动态的人,这个网站能省去你到处找论文和模型的时间,论文直接在线看,还有排行榜和Feed订阅,建议收藏试试。原文稍后读已读值得跟进有用关注 AI聚合
01:51lmarena.ai@lmarena_aiAgent Arena 发布了完整的智能体排行榜,用户可以在 arena.ai 上查看各智能体的表现排名。该排行榜基于多种任务和场景对智能体进行评估,为开发者提供了选择智能体的重要参考。排行榜的发布标志着智能体评估标准化的重要一步,有助于推动智能体技术的发展。AI产品智能体排行榜评估推荐理由:智能体开发者可以快速了解当前各智能体的实际表现,选择最适合自己任务的模型。原文稍后读已读值得跟进有用关注 智能体
07:42Ideogram@ideogram_aiIdeogram 4.0 在第三方评测平台 DesignArena 的排行榜上成为全球第一的开源权重文生图模型。其性能仅次于 OpenAI 和 Google 的闭源模型,在开源模型中处于领先地位。该模型提供前沿质量、完全可定制性和数据隐私保护。这标志着开源文生图模型在质量上又迈出了一大步。AI模型Ideogram 4.0开源/仓库文生图模型10 个信源在谈事件专题推荐理由:开源社区终于有了一个能接近闭源巨头(OpenAI/Google)的文生图模型,做图像生成应用或研究的团队可以直接下载权重,享受前沿质量与数据隐私。原文稍后读已读值得跟进有用关注 Ideogram 4.0
12:13官方账号arXiv cs.LG@Anany Kotawala该论文指出,在 Open LLM Leaderboard v1 和 MMLU-Pro 等公开排行榜中,许多配对排名在常规配对检验分辨率目标下未达标。具体而言,40 个 Open LLM Leaderboard v1 配对比较中有 11 个、9 个 MMLU-Pro 相邻排名对中有 4 个在显著性水平 0.05、检验功效 0.8 下无法分辨。MMLU-Pro 在真实主题级聚类下问题更严重,9 个中有 6 个不达标。研究将配对 LLM 评估视为假设检验问题,提出分辨率比 q = N/N* 作为核心诊断指标。同时发现,广泛使用的非配对 Cohen-h 加 (1-rho) 简化方法在接近比较场景下会低估所需样本量约两倍,导致多个主流计算工具(Cohen 1988、G*Power、R pwr)继承这一缺陷。即使采用多重校正和时序检验,不达标模式依然存在。论文LLM评估统计检验排行榜推荐理由:这篇论文戳破了 LLM 排行榜的统计幻觉——很多排名差异其实不显著,做模型评估的团队和关注排行榜的开发者看完会重新审视自己的比较方法。建议点开,避免被虚假的排名差异误导。原文稍后读已读值得跟进有用关注 LLM评估
14:02Mustafa Suleyman@mustafasuleyman微软 AI 团队发布了 MAI-Image-2.5 模型,在文生图排行榜上位列第三,标志着图像生成质量的又一次重大进步。该模型在细节、构图和语义理解方面表现出色,接近顶级水平。微软 CEO 穆斯塔法·苏莱曼表示,随着 Build 大会临近,团队还有更多成果即将发布。这一进展进一步巩固了微软在生成式 AI 领域的竞争力。AI模型微软MAI-Image-2.5文生图推荐理由:文生图赛道又添猛将,MAI-Image-2.5 直接杀入前三,做设计、内容创作或 AI 应用的团队值得关注——微软 Build 大会前放出这一信号,后续可能还有大招。原文稍后读已读值得跟进有用关注 微软
03:23lmarena.ai@lmarena_ai微软 AI 团队推出的 MAI-Image-2.5(预览版)在文生图竞技场排行榜上以 1254 分位列第三,相比前代 MAI-Image-2 提升了 72 分。此前该榜单前五名仅由 Google DeepMind 和 OpenAI 占据,微软的加入打破了这一格局。该模型在图像质量上取得了显著进步,且微软 Build 大会即将到来,预计会有更多更新。AI模型微软MAI-Image-2.5文生图10 个信源在谈事件专题推荐理由:微软在文生图领域首次跻身顶级阵营,做图像生成或 AI 应用的开发者值得关注其后续在 Build 大会上的发布。原文稍后读已读值得跟进有用关注 微软
07:59Recraft@recraftaiRecraft 的 V4.1 Utility Pro 模型发布仅一周,就在 Design Arena 2026 图像生成器排行榜的图形设计类别中升至第7名,Elo 评分达1243。该模型与 LumaLabsAI 的 UNI-1.1 和 Black Forest Labs 的 FLUX.2 [flex] 处于同一性能水平,使 Recraft 跻身全球前五的图像生成实验室。目前 Recraft 已有两个模型上榜,团队表示这是重大突破。用户可在 Recraft Studio 中直接体验。AI产品图像生成RecraftV4.1 Utility Pro推荐理由:图形设计师和 AI 创作者又多了一个高性价比的图像生成选择——Recraft V4.1 Utility Pro 一周就冲进前七,性能与头部模型持平,建议试试看能不能替代你现在的工具。原文稍后读已读值得跟进有用关注 图像生成
10:13官方账号arXiv cs.AI@Yuxuan Gao, Megan Wang, Yi Ling Yu精选该研究将分裂共形预测和自适应共形推断(ACI)应用于连续AI智能体评估,提供无分布假设的覆盖保证。在24小时预测窗口内,共形区间在所有名义水平上的校准误差低于0.02,ACI在智能体发布后正确将区间扩大35%后重新收敛。研究还开发了多智能体管道的组合不确定性界限、成对排名的共形弃权规则(控制假排名率)以及排行榜级多重检验的FDR校正弃权。通过每小时收集18个实时信号评估50个智能体,发现每个智能体的条件覆盖集中在名义水平附近(均值80.4%,90%的智能体在[72%,90%]内),跨来源情感分歧可预测排名不稳定性(r=0.64, p<0.01)。代码和数据已以CC BY 4.0协议发布。论文AI智能体评估不确定性量化共形预测推荐理由:做AI智能体评估或排行榜的团队终于有了统计严谨的不确定性量化工具——无需分布假设即可保证覆盖,还能处理多智能体管道和排名稳定性问题,建议做评估基准的开发者直接看论文和代码。原文稍后读已读值得跟进有用关注 AI智能体评估
22:29官方一手Hugging Face: Blog(博客/媒体)精选76°IBM Research 在 Hugging Face 上推出了 Open Agent Leaderboard,这是一个用于评估 AI 智能体性能的公开排行榜。该排行榜通过一系列标准化任务测试智能体的规划、工具使用和推理能力,旨在为开发者提供可复现的基准。目前已有多个主流模型参与评测,包括 GPT-4、Claude 等。这一举措有助于推动智能体领域的透明化和标准化,让开发者能更直观地比较不同智能体的实际表现。行业智能体排行榜IBM推荐理由:智能体评估一直缺乏统一标准,IBM 这个排行榜让开发者能直接对比不同模型的规划与工具使用能力,做智能体应用的团队值得关注。原文稍后读已读值得跟进有用关注 智能体
01:41berryxia@berryxiaSlides Arena 发布了基于 370 万+ 真实创作者使用场景的 Agentic Slides 排行榜,Anthropic 的 Opus 4.7 包揽前两名,智谱的 GLM 5.1 位列第三。该排行榜基于真实世界的幻灯片生成场景,强调逻辑、创意和设计感,而非实验室 benchmark。结果显示 Claude 在 Agentic 设计领域仍具领先优势,但 GLM 表现亮眼。AI产品GLMOpusAgentic Slides10 个信源在谈事件专题推荐理由:做 PPT 设计或 Agentic 内容生成的团队,这份基于 370 万真实场景的排行榜值得参考——GLM 5.2 能紧追 Opus 4.7,说明国产模型在创意密集型任务上已有竞争力,建议点开看看完整榜单。原文稍后读已读值得跟进有用关注 GLM
15:02xiaomimimo@XiaomiMiMo73°小米MiMo-V2.5-Pro在最新Arena排行榜(2026年4月26日)中取得多项突破:在Text Arena专家级排名全球第6、开源模型第1,并在中国模型中排名第1,小米实验室整体排名全球第3,仅次于Anthropic和OpenAI。该模型在Text Arena综合排名中位列开源第2,在Code Arena网页开发排名中位列开源第3。此外,在Hard Prompts、指令遵循、长查询等4个子榜单中均获开源第1。这些成绩基于真实社区盲评,反映了模型的实际能力。AI模型小米MiMo-V2.5-Pro开源模型10 个信源在谈事件专题推荐理由:小米MiMo-V2.5-Pro在多个高难度榜单中超越众多闭源模型,做模型选型或关注开源生态的开发者值得关注——它证明了开源模型在核心智能和实际编码任务上已能媲美顶级闭源方案。原文稍后读已读值得跟进有用关注 小米
15:02kimi_moonshot@Kimi_MoonshotKimi K2.6 在 OpenRouter 的每周大语言模型排行榜中升至第一名。这一成绩反映了开发者社区对 Kimi 模型的认可和实际使用效果。Kimi 团队对开发者的支持表示感谢,并承诺将继续迭代优化。对于关注模型性能排名的开发者来说,这是一个值得关注的动态。AI模型KimiK2.6OpenRouter推荐理由:Kimi K2.6 在 OpenRouter 周榜登顶,说明它在实际使用中获得了开发者认可,做模型选型或对比的团队可以关注这个新选择。原文稍后读已读值得跟进有用关注 Kimi