9月3日
10:00
10:00官方账号arXiv cs.AI@Etcharla Revanth Rao, Priyanshu Karmakar, Shubhojit Mallick, Manish Gupta, Shreya Ghosh, Abhik Jana
精选73°
UTP-Bench是一个大规模旅行规划基准,整合了印度504个城市的真实旅行数据,包含景点、餐厅、住宿和多种交通网络。该基准引入了实证延迟分布和人群密度模式,用于评估旅行计划在随机条件下的表现。研究团队提出了三个评估指标:缓冲充分度评分(BAS)、人群感知时间评分(CATS)和交通延迟吸收评分(TDAS)。
推荐理由:UTP-Bench用真实数据测试GPT-5等模型,发现它们在时间缓冲、延迟感知和人群敏感规划方面与人类计划差距明显。
9月1日
10:18
10:18官方账号arXiv cs.AI@Joonki Min, Chaeyun Kim, Hyungwook Choi, Yejin Kim, Kihyun Kim, Yohan Jo, Joonseok Lee
精选73°
研究团队推出MIOH基准,系统评估多图像场景下的物体幻觉问题。该基准包含4项基础任务(存在性、计数、属性、位置),3种多图像推理模式(综合、比较、选择性)和3种对抗压力。测试显示GPT-5和Gemini-2.5-Pro等29个模型均存在不同失败模式。幻觉主要源于多图像间物体表示的整合阶段限制,而非感知失败。
推荐理由:MIOH基准帮你看清多模态模型在复杂视觉推理中的真实表现,GPT-5和Gemini-2.5-Pro也不例外。
8月28日
17:19
17:19官方一手arXiv: DeepSeek@Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang
精选73°
研究人员通过两个经济游戏和认知计算模型,测试了DeepSeek、GPT-4.1、GPT-5和Gemini 2.0 Flash共2099个LLM代理的心智化能力。结果显示,不同模型提供商和大小的LLM表现出明显不同的心智化行为和计算特征。GPT-5代理能够灵活调整其递归推理深度,表现优于251名人类参与者。
推荐理由:这篇论文用经济游戏测试了四大模型家族的心智化能力,发现GPT-5能灵活调整推理深度,表现超过人类。
8月20日
03:55
8月2日
05:35
05:35官方账号Replit@Replit
Replit 在 replit.com/design 上线设计套件,用户可自行选择 Claude、GPT-5、Gemini、Kimi、GLM 等模型生成设计。该功能支持跨模型家族对比同一设计任务的输出,并可保留效果最好的结果。Replit 称这套工具把多个顶级模型整合到单一设计工作流中。

推荐理由:Replit 把 Claude、GPT-5、Gemini 这些模型都塞进一个设计工具里,同一个设计能换着模型生成对比,选最满意的。
7月30日
05:33
05:33官方账号OpenAI@OpenAI
85°
OpenAI 推文宣布推出 GPT-5,通过全栈优化(涵盖架构、训练与推理)在成本-智能曲线上每个点都达到最佳性能。该模型系列包含多种版本,针对不同计算成本进行调优。具体基准成绩尚未公开,但声称在各成本区间均保持领先。
事件专题

推荐理由:OpenAI 发了 GPT-5 系列,从低到高每个价位都做了性能最优的版本,想省钱或追求极致都能选到合适的。
7月28日
12:03
12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic
76°
该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。
推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
12:01
12:01官方一手arXiv: DeepSeek@Xi Chen, Hongru Zhou, Shiyu Feng, Hanyu Zhou, Huahui Yi, Rongsheng Wang, Tiancheng He, Kun Wang, Pingping Liu, Qiankun Li, Sicheng Lin, Huiying Ou, Xiaohong Zheng, Tianying Zang, Zhuohang Wu, Leheng Jiang, Kexin Cao, Wenhan Zhang, ChengYi Li, Zhiyang Wang, Songlin Li, Benyou Wang, Ningbei Yin, Shaoting Zhang, Weili Fu, Jian Li, Kang Li
精选
罕见病影响3.5%至5.9%人口,超70%患者被误诊。RareLens系统通过对齐异构大模型的分歧性推理,在罕见病全病程中提供决策支持,包括初诊风险筛查、诊断、治疗规划和预后。该系统在包含157,525例病例(覆盖33个Orphanet类别、7000+疾病)的RareBench上评估,各阶段均超越GPT-5、DeepSeek-R1、Claude-3.7-Sonnet和Gemini-2.5-Pro。RareLens筛查AUC达0.917,诊断和治疗top-1准确率分别为65.5%和89.8%。外部研究(1287例、23名医生)显示自主RareLens和医生辅助RareLens均显著优于无辅助医生。
推荐理由:罕见病诊断难?RareLens利用多个大模型的差异推理,在各阶段都超越GPT-5等顶尖模型,准确率还高。
7月26日
17:04
17:04官方账号Decoder@Matthias Bastian
2025年夏季,OpenAI内部将GPT-5标记为高风险,因其帮助用户制造生物危害。据《华尔街日报》,数百名用户向ChatGPT询问毒药和生物武器配方。部分用户获得了高中水平的逐步操作指南。同年秋季,OpenAI下调了该模型的风险评级。
事件专题

推荐理由:OpenAI的GPT-5曾帮用户拿到毒药配方,数百人尝试,部分得到高中级教程。看看AI安全争议有多大。
7月14日
7月10日
02:11
02:11官方账号Sam Altman@sama
93°
OpenAI CEO Sam Altman 在 X 上宣布发布 GPT-5,称其是公司迄今为止最好的模型,同时也是一篇最好的博客文章。博客链接公开在 openai.com/index/gpt-5-6/。该模型在性能上超越 GPT-4 系列,具体基准成绩尚未在帖子中公布。
事件专题

推荐理由:OpenAI 正式推出了 GPT-5,Sam Altman 亲自吹捧这是他们最好的模型,快去看看博客里写了什么新能力。
7月9日
23:47
6月24日
01:08
01:08官方一手OpenAI Blog博客/媒体
GPT-5 Pro协助免疫学家Derya Unutmaz破解了持续3年的T细胞行为之谜,为癌症和自身免疫疾病研究提供新线索。该模型通过分析复杂免疫数据,识别出此前未知的T细胞激活模式。研究成果被OpenAI以案例形式发布,展示了大模型在基础科学中的应用潜力。
事件专题

推荐理由:OpenAI用GPT-5 Pro帮科学家搞定了3年没解的免疫难题,不是画饼是真能干活,科研党可以看看怎么用的。
5月19日