9月3日
12:16
12:16官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu
精选73°
研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。
推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。
9月2日
8月26日
14:05
8月25日
10:24
10:24官方一手arXiv: DeepSeek@Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang
提出ISAC框架,结合代码差异和问题信息生成提交信息,ApacheCM-Issue数据集支持评估,GPT-5.5和DeepSeek-V4-Flash模型测试,问题信息提升模型性能,结构化问题摘要改善感知完整性,但可能牺牲上下文细节。
事件专题

推荐理由:研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。
8月18日
00:20
00:20官方一手@OpenAIDevs@OpenAIDevs
精选
房地产初创公司Hypha AI用GPT-5.6 Luna做文档提取,以GPT-5.5 1/18的成本保住了98%的准确率。金融研究公司RogoAI通过程序化工具调用抓取文件并分析数据,输入token减少21%且评估质量持平。该数据由OpenAI开发者官方账号发布。
事件专题

推荐理由:OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。
8月15日
02:05
02:05elvis@omarsar0
79°
Faraday是一个27B参数的智能体,基于Replica框架将论文复现转化为可扩展的强化学习任务。它调用编码agent作为工具,在held-out研究复现上击败了Claude Opus 4.8和GPT-5.5。奖励信号来自自动生成的rubric judge,与人类评估一致性高。论文已发布在arxiv.org/abs/2608.13331。
事件专题

推荐理由:一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。
8月12日
17:56
17:56官方一手arXiv: OpenAI@Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma
arXiv新论文提出两阶段框架,针对医疗假设验证的选择题场景,仅在模型不确定时进行本体论接地,管理覆盖率与准确率的权衡。实验显示,弃权并非随机,而是反映真实不确定性,弃权预测的置信度较低。在GPT-5.5和DeepSeek-R1两个前沿模型上,该框架将问题级准确率从82.9%提升至92.5%,提升9.6个百分点;假设级准确率从92.0%提升至96.2%,提升4.2个百分点。在MedReason和MedQA基准上的实验表明,弃权可作为选择性推理精修的控制信号,无需显式构建知识图谱即可达到图谱级性能。
推荐理由:这篇论文教你怎么用弃权信号做推理精修,不用建知识图谱,医疗问答准确率直接涨9.6个点,GPT-5.5和DeepSeek-R1都试过。
7月31日
12:35
12:35官方账号arXiv cs.LG@Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun Cho
AskChem 将论文拆解为带来源 DOI 和原文引用的原子声明。目前已索引来自 14.7 万篇论文的 240 万条声明,提供网页、REST、SDK 和 MCP 接口。在 AskChem-Bench 基准上,接入 GPT-5.5 阅读器后 DOI 可解析率达到 100%,未检索时为 88.3%。系统还提供证据图和分类检索,支持跨论文验证信息。
推荐理由:化学论文里找结论太费劲?AskChem 把 14.7 万篇论文拆成带引用的声明,直接搜观点还能看来源,AI 也能通过接口调。
7月30日
09:21
09:21官方一手arXiv: OpenAI@Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane
NISPO是一个基于RDKit的开源Python包,用于生成系统IUPAC名称。它由OpenAI Codex配合GPT-5.5模型通过自改进循环开发而来。在SureChEMBL的268万分子上训练后,在PubChem的1.03亿测试集上达到98.1%的往返准确率。NISPO使用OPSIN工具验证名称正确性。项目已开源在GitHub。
事件专题

推荐理由:想自动生成分子IUPAC名称?试试NISPO,开源、基于RDKit,在1亿分子上验证准确率98.1%。
7月27日
16:15
16:15官方一手pandaily@contact@pandaily.com (Pandaily)
中科院计算所发布智境(ZhiJing)社交智能系统,包含SoMBench评估基准和Zing模型。Zing在社交认知任务上超越GPT-5.5,采用FLARE自进化训练和OPD蒸馏技术。该系统使AI能理解社交情境、情绪和未言明信号。

推荐理由:中科院搞了个能懂人情世故的AI模型Zing,社交认知吊打GPT-5.5,值得一看。
7月24日
12:01
12:01官方一手arXiv: DeepSeek@Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang
精选
研究者发布两个 Lean 4 基准:Lean-QuantumAlg-Bench(36 个任务)和 Lean-QIT-Bench(40 个任务),用于评估 AI 在量子算法和量子信息理论上的定理证明能力。在四个模型(GPT-5.5、Kimi K3、DeepSeek V4-Pro、MiniMax M3)中,最高难度加权得分分别为 60.4/100 和 59.6/100。库增强推理(LAD)在所有八个模型-基准对比中均提升得分和完成率,最高提升 15.9 分。模型在量子模拟、量子学习、量子信息度量等领域的证明能力存在薄弱环节。
事件专题

推荐理由:想知道 AI 定理证明在量子计算领域到底多强?这篇论文给了两个新基准和四个模型实测分数,LAD 方法能提升最高 15.9 分,很实在。
04:24
04:24Fireworks AI@FireworksAI_HQ
71°
Arize AI 与 Fireworks AI 联合对 10 个模型进行了 2400 次 agent 运行基准测试,包括 Kimi K3。结果显示,Kimi K3 在整体表现上接近 GPT-5.5。不同模型在不同任务类型上各有优势,按任务难度路由可同时优化成本和覆盖率。重试和静默故障显著改变了经济性。开发者应关注每次成功任务的成本而非 token 价格。
事件专题

推荐理由:别只盯着 token 价格了,Arize 和 Fireworks 测了 10 个模型的 2400 次 agent 运行,发现按任务难度的路由能省钱又提高成功率。Kimi K3 还追平了 GPT-5.5。
7月23日
7月22日
12:30
12:30官方账号arXiv cs.AI@Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman
新基准BioSecBench-Surveillance包含100个评估任务,覆盖7个类别,从分类到基因工程检测。16个模型-工具组合在3962次尝试中,最佳配置Opus 4.8 with PI仅达50.2%准确率,与GPT-5.5 with Codex并列。Opus 4.7 with PI为49.6%,Sonnet 4.6 with PI为48.6%。即使调用正确工作流,错误仍源于参考序列、阈值、过滤器等选择失误。该基准为衡量下次疫情爆发时AI代理的可信度提供了标准。
事件专题

推荐理由:想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。
7月21日
7月20日
16:06
16:06官方一手Pandaily@contact@pandaily.com (Pandaily)
Moonshot AI旗下Kimi K3模型在AlphaEngine的专有IRB投资研究基准测试中,以更高得分击败GPT-5.5和OPUS-4.8。测试涵盖时间判断、证据边界控制和前提修正三个维度。Kimi K3已部署在AlphaEngine平台上。
事件专题

推荐理由:Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。
7月14日
06:09
06:09官方账号Simon Willison’s Weblog博客/媒体
Simon Willison查看了Datasette开源项目的GitHub代码提交频率图,发现近期出现巨大峰值。该峰值与Opus 4.8、GPT-5.5、Fable 5和GPT-5.6 Sol等高级编码AI模型的使用时间吻合。这些模型显著提升了作者的代码产出频率,可视化地展示了AI辅助编程的效果。
事件专题

推荐理由:Simon Willison用GitHub提交频率图,直观展示了Opus 4.8等AI编码助手让他的代码产出暴增,有趣又有说服力。