8月11日
02:00
02:00OpenRouter@OpenRouterAI
OpenRouter 在 X 平台发布帖子,宣布其博客已更新公告内容。公告页面提供了相关的基准测试结果和详细说明。该帖子目前获得 1 次点赞、244 次浏览,暂无回复和转发。完整内容可访问 openrouter.ai/blog/announcem… 查看。
推荐理由:OpenRouter 发了条公告,说博客里有更多详情和 benchmark,想了解发生了什么可以直接点进去看。
00:32
00:32a16z@a16z
精选
去年最佳计算机使用模型在真实桌面操作的标准基准上得分42%,如今最佳模型得分已达85%,而人类测试者在相同任务上得分约72%。数据来自a16z分析师Fabrizio Serafini、Seema Amble和Zephratic的调研,显示该领域在过去18个月取得显著进展。

推荐理由:a16z发了份计算机使用智能体的数据,一年前最强模型才42分,现在到85分了,比人类还高,想了解进展可以看这个。
8月10日
10:27
10:27官方账号arXiv cs.AI@Rodrigo Ferreira Rodrigues, Karim Radouane, Jose G Moreno, Lynda Tamine
GeoBenchLLM是一个评估大语言模型地理相关任务能力的基准,整合了12个公开数据集。该基准覆盖地理空间和时间理解两类任务,测试了多个主流LLM。结果显示,推理能力和模型尺寸对整体性能影响显著。基准代码已在GitHub公开。
推荐理由:想测LLM的地理常识?这个新基准GeoBenchLLM用12个数据集考了主流模型,结论是模型越大、推理越强,GitHub上可跑。
8月7日
23:43
07:46
07:46官方账号Greg Brockman@gdb
Ethan Bloch在GPT-5.2上开展的个人财务AI实验获得良好结果。OpenAI的个人财务基准曾显示,从5.3到5.5版本有巨大提升,该实验如果今天运行成绩会更好。目前模型已推进到5.6,作者称虽无外部基准,但性能更优。
事件专题

推荐理由:OpenAI的人说GPT-5.6在个人财务上更强了,还有5.2的实验结果和5.3到5.5的基准对比,想了解AI理财能力的可以看。
8月6日
21:51
19:13
19:13官方账号阿里通义 Qwen@Alibaba_Qwen
精选
Qwen3.8-Max在Artificial Analysis Intelligence Index上排名第五,并在Agentic Index上位列第一。该模型由阿里通义千问团队发布,当前基准成绩显示了其在智能体任务上的领先表现。团队表示将继续推进模型迭代。

推荐理由:阿里刚发的Qwen3.8-Max,智能体能力跑到第一了,总榜第五,想追新模型可以看看。
09:45
01:48
01:48AK@_akhaliq
精选
MerchantBench 是一个专门评测 LLM 智能体在电商运营中长期连贯性的新基准。MerchantBench 包含跨多轮任务的测试场景,用于检验智能体在长时间运营中的记忆与决策一致性。论文全文已发布在 Hugging Face 平台上。

推荐理由:MerchantBench 专门测 LLM 智能体在电商里的长期连贯性,比单轮问答更贴近实际运营,可以看看。
8月5日
8月4日
23:40
23:40lmarena.ai@lmarena_ai
精选
LMArena 公布 DeepSeek-V4-Flash-20260731(High) 的五项关键信号。总体得分上升 1.98%,确认成功项提升 6.99%,好评对差评比增加 1.54%。可引导性下降 2.31%,Bash 恢复得分 2.53%,工具幻觉率 1.2%。数据来自竞技场真实用户反馈。
事件专题

推荐理由:想知道 DeepSeek 最新版行不行?看这五个真实用户信号,总体涨近2%,确认成功涨7%,但可引导性跌了。
09:30
09:30官方账号arXiv cs.AI@Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez
该研究构建了包含1,600个人类编写的幻觉样本数据集,覆盖中、英、法、意四种语言,并同时收集了来自五个视觉语言模型的18,400个样本进行对比。所有样本采用细粒度的跨度级标注方案来标记幻觉。实验发现,人类编写的样本在标注一致性上更高,且便于控制数据集内容,同时与模型生成样本在分布上保持相似。这表明人类数据可以替代模型生成的幻觉基准,用于更稳定的模型幻觉评估。
推荐理由:这篇论文用1,600个人类写的幻觉样本对比了18,400个模型生成的样本,发现人类样本更稳定、更好控制,以后测幻觉不用老换模型了。
8月3日
16:19
16:19IT之家博客/媒体
Arena平台发布2026年第31周AI大模型排行榜。阿里qwen3.8-max以1496分位列综合榜第5,距榜首claude-fable-5仅差13分。月之暗面kimi-k3-max以1485分排综合榜第13。代码榜中,kimi-k3-max和qwen3.8-max分别以1531分和1530分进入Top10。前端开发榜kimi-k3-max以1676分排第二,字节seedream-5.0-pro进入AI生图榜第6名。
事件专题

推荐理由:阿里新模型qwen3.8-max一上榜就冲到综合第五,只比榜首Claude差13分;kimi-k3-max代码也进了前十,国产模型进步挺明显,榜单值得翻翻。
8月2日
8月1日
03:11
03:11lmarena.ai@lmarena_ai
Thinking Machines 推出新模型 Inkling-Small。Inkling-Small 没有突破性能上限,但紧邻当前最强的几个模型。Thinking Machines 在官网发布了相关对比信息。
事件专题

推荐理由:Thinking Machines 新出的 Inkling-Small 虽然没登顶,但官方给了它和头部模型的对比图,想了解它大概什么水平可看。
7月31日
11:36
11:36官方账号arXiv cs.AI@Hanzhang Zhou, Panrong Tong, Xu Zhang, Quyu Kong, Chenglin Cai, Tianyu Xia, Gongjie Zhang, Jianan Zhang, Long Li, Long Chen, Lei Wang, Gaole Dai, Pengxiang Li, Liangyu Chen, Yue Wang, Steven Hoi
Qwen-UI-Agent 是覆盖移动、电脑、网页和 DeepSearch 环境的 GUI 智能体,结合沙盒环境与真实设备移动运行时。其统一动作空间支持 GUI 操作与 CLI 执行交错,并可在单次模型回合中生成批量动作。AutoResearch 数据飞轮用智能体构建任务与环境,在线强化学习支持超过 100 步轨迹,在超过 10,000 个并发环境中训练。在基准测试中,移动端达到 MobileWorld 82.1%、MobileWorld-Real 92.2%、AndroidDaily 97.5%;电脑端 OSWorld-Verified 79.5%、WebArena 73.6%。
事件专题

推荐理由:Qwen 团队发了 UI-Agent,一个模型统一手机、电脑、网页操作,移动端跑分超 Opus 4.8,还能插命令行,挺能打。