9月3日
12:14
12:14官方账号arXiv cs.AI@Urja Pawar, Rajitha Ramanayake, Owen O'Neill, Nabeel Kemal, Abhishek Mandal, Houssem Chatbri, Christopher Martin
精选73°
研究人员提出两种互补信号检测黑盒大模型幻觉:语义熵和token不确定性。他们开发了TopK方法聚合token信号,CoCoA方法结合目标响应不确定性和语义相似性,以及Gated和Stacked两种监督方法。研究在7个基准上测试了4个语言模型,Stacked方法在近半数情况下表现最佳,TopK和CoCoA无需监督标签也具竞争力。
推荐理由:这篇论文教你如何检测黑盒大模型的幻觉,有4种方法可选,无需监督标签也能用。
9月2日
10:11
10:11官方账号arXiv cs.LG@Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang
精选73°
研究团队推出SCILAWS-BENCH基准,包含118个问题,源自381篇科学论文,覆盖291个候选定律和约800万真实数据点。该基准包含SCILAWS-REAL和SCILAWS-PARALLEL两种设置,分别评估模型从固定观测中提出定律和主动查询世界以恢复隐藏定律的能力。研究发现预测拟合度可能与科学有效性存在差异,模型记忆能力影响其能否再现或超越已发表公式。
推荐理由:研究人员发布科学定律发现基准SCILAWS-BENCH,包含真实数据和合成世界两种测试场景,评估LLM科学发现能力。
9月1日
10:17
10:17官方账号arXiv cs.AI@Debarpan Bhattacharya, Malay Phadke, Sriram Ganapathy
精选73°
研究人员提出BiG-SURE,一种基于跨温度语义一致性的不确定性估计方法。该方法通过构建锚点-探针二分图,使用NLI蕴含分数计算置信度。在文本QA、多语言QA和多模态QA任务中,BiG-SURE在黑盒模型设置下提升了平均弃权AUROC。
推荐理由:BiG-SURE能帮你评估黑盒大模型的不确定性,无需访问模型参数,简单实用。
8月31日
09:09
09:09官方账号arXiv cs.LG@Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais
精选73°
研究显示滑动窗口注意力(SWA)在多个大语言模型的各种下游任务上表现与或优于后训练线性注意力模型。在长上下文推理任务中,SWA性能比线性注意力高2到10倍。SWA无需后训练,速度快且内存需求低。
推荐理由:SWA比线性注意力更高效,无需后训练就能实现更好性能,内存占用低,推理速度快。
8月28日
21:10
21:10官方账号Anthropic@AnthropicAI
精选
Anthropic表示在开源MHS模型前仍需更多研究。该模型目前缺乏物理直觉,仅通过文本和图像学习物理世界知识。研究预览版将帮助构建更多安全评估,加强AI在物理世界应用的保护措施。
事件专题

推荐理由:Anthropic推迟开源MHS,称LLMs仍需提升物理直觉能力,研究预览版将强化AI物理世界应用的安全评估。
8月27日
09:27
09:27官方账号arXiv cs.AI@Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman, Cheston Tan, Leshem Choshen
本研究通过多语言自我对弈,量化了大型语言模型在不同语言中技能的不一致性。测试了三个模型在八种语言和六种游戏中的表现,发现同一模型在不同语言中的表现差异显著,包括胜负差距、无效动作和策略倾向。结果表明,技能差异是真正多语言模型发展中的主要障碍之一。
推荐理由:这篇论文揭示了大型语言模型在不同语言中的技能差异,对于理解多语言模型的发展具有重要意义。
09:19
09:19官方一手arXiv: DeepSeek@Xiao Fan, Jingyuan Li, Hongbin Guo, Yubo Han, Yi Zhang
This paper proposes claim-locked reporting, a protocol that ensures the statistical evidence in scientific reports is fixed by structured results before prose generation. It improves reproducibility by 37.4 and 20.5 points in fMRI and randomized controlled trial reporting, respectively. DeepSeek's fMRI cost analysis demonstrates lower token use and generation latency with this method.
推荐理由:This paper introduces a new reporting protocol for scientific reports that could significantly improve reproducibility. It's a must-read for anyone interested in improving the quality of scientific reporting and the use of LLMs in research.
8月25日
10:26
10:26官方一手arXiv: DeepSeek@Toghrul Abbasli, Kentaroh Toyoda, Yuan Wang, Li Chen
This paper introduces claim-level confidence calibration for LLMs, addressing the issue of misaligned confidence with factual correctness. It proposes a framework that decomposes responses into claims and assigns calibrated confidence using inference-time signals. The framework is evaluated on six recent models and shows reduced calibration error on factual questions while revealing failure modes on adversarial false-premise questions.
推荐理由:This research provides a new approach to improve the reliability of LLMs in decision-making by calibrating claim-level confidence, which is particularly useful for high-stakes domains where accurate uncertainty estimation is crucial.
8月24日
21:34
10:50
10:50官方账号arXiv cs.AI@Yinan Liu, Zihan Zhou, Zichun Jin, Xinyu Wang, Bin Wang, Xiaochun Yang
本文提出PSL框架,将半结构化政治记录转化为LLMs的推理证据,通过提取立场信号和结构信号,在三个真实数据集和多个LLMs上,PSL在预测性政治问答任务中优于基线模型。
推荐理由:PSL框架将半结构化数据转化为LLMs推理证据,在预测性政治问答中表现优异,值得一试。
04:13
04:13官方账号Simon Willison’s Weblog博客/媒体
Drew Breunig指出,在Fable出现之前,优化编码工具似乎没有必要,因为新模型的出现往往能解决大部分问题。然而,Fable的出现虽然令人惊叹,但其高昂的成本使得Opus、5.6、K3和GLM等模型已经足够应对大多数需求。因此,人们开始思考哪些工作应该放在哪里。
推荐理由:Drew Breunig分享了他对Fable的看法,揭示了免费午餐时代的终结,对于关注LLM定价和AI发展的读者来说,这是一篇值得阅读的文章。
00:33
8月22日
00:38
00:38官方账号Simon Willison’s Weblog博客/媒体
精选
Thomas Ptacek提倡为即使是个人工具的最小版本也构建真正的原生用户界面,因为编码代理降低了获得可用GUI的成本。他分享了关于自己编写的带宽和GPU监控macOS任务栏应用程序的经验,并鼓励将CLI转换为原生应用,这可能会改变你的思维方式。
推荐理由:Thomas Ptacek分享了他的经验,鼓励将CLI转换为原生应用,这是一个值得尝试的改变!
8月21日
12:05
02:03
8月20日
07:16
07:16官方账号Simon Willison’s Weblog博客/媒体
杰里米·莫雷尔提出观点,认为大型语言模型(LLMs)为网页可扩展软件带来新机遇;该模型大幅降低开发插件成本,现代沙盒原语保障安全边界;开发者可构建可靠核心应用,让用户借大型语言模型补充功能。
推荐理由:杰里米·莫雷尔讲了可扩展软件和大型语言模型的事儿,能帮开发者做新应用,用大型语言模型补充功能,比以前方式方便安全。
7月28日
12:12
12:12官方账号arXiv cs.AI@Zhenhan Gao, Marvin Muñoz Barón, Umm-e Habiba, Daniel Graziotin, Stefan Wagner
一篇针对34名程序员的用户研究发现,在AI代码审查中提供详细解释(条件A)获得最高信任评分(3.99/5),但仅提供审查反馈(条件B)反而获得最高同意率(89.22%),说明更多解释会促使开发者更频繁地质疑AI建议。无解释(条件C)的信任和同意率均最低。解释程度并未显著影响审查耗时。该研究为设计可信的AI代码审查系统提供了实证依据。
推荐理由:这篇论文告诉你:给AI代码审查加解释,反而可能让人更不听话。详细解释信任高但同意率低,这结论挺反直觉的。
7月15日
02:33
7月14日
12:22
12:22官方账号arXiv cs.LG@Shikai Qiu, Marc Finzi, Yujia Zheng, Kun Zhang, Andrew Gordon Wilson
精选
传统参数压缩方法如量化产生码长随模型参数缩放,而prequential coding码长取决于数据熵。本文提出的requential coding使码长独立于参数数和数据熵,通常比prequential短数个数量级。在PAC-Bayes界中,该方法为十亿参数LLM提供了当前最优的泛化保证。实验还发现低熵文本比高熵图像包含更多可学习结构。
推荐理由:这篇论文提出Requential Coding,码长不跟着模型大小和数据熵跑,比之前的方法短好几个数量级,还给十亿参数大模型给出了最牛的泛化保证。