09:07官方账号arXiv cs.AI@R. Thomas McCoy, Paul Soulos, Tal Linzen, Paul Smolensky精选73°研究人员发现神经网络内部表示可被符号结构近似替代。该研究涵盖小型神经网络和大型语言模型,在算术、逻辑、计算机代码和语言四个领域验证了这一发现。通过精确干预内部表示,可定向修改LLM行为,证明其依赖所识别的符号结构。论文神经网络符号结构大型语言模型推荐理由:这篇论文揭示了神经网络如何通过隐式符号结构实现高性能,为理解AI工作机制提供了新视角。原文稍后读已读值得跟进有用关注 神经网络
11:42官方账号arXiv cs.LG@Chengpiao Huang, Kaizheng Wang该研究提出了一种合成增强推理的通用框架,通过确定合成观测值的数量和权重来优化统计推断。研究人员建立了规模-权重前沿,为每个权重指定最大合成样本规模,确保所有较小规模都能达到目标任务边际覆盖率。在大型语言模型增强调查数据的实验中,该方法实现了目标覆盖率并显著缩小了置信区间。论文合成数据统计推断大型语言模型推荐理由:这篇论文教你如何用合成数据提升统计推断效果,特别适合数据稀缺场景的研究者。原文稍后读已读值得跟进有用关注 合成数据
10:17官方账号arXiv cs.LG@Suchit Gupte, Xueru Zhang, Mohammad Mahdi Khalili精选稀疏自动编码器(SAEs)广泛用于解释大型语言模型(LLMs)的内部表示,但其后置模型压缩下的可靠性理解不足。本研究系统地研究了剪枝如何影响SAE行为,并从理论上证明了对于固定的SAE,其影响受扰动能量(协方差加权的范数)控制。这一观点揭示了幅度剪枝的关键局限性:通过忽略激活几何形状,它扭曲了学习到的表示空间并降低了SAE功能。相比之下,Wanda和SparseGPT等激活感知方法隐式地控制扰动能量,因此在保留SAE行为方面具有更高的鲁棒性。此外,我们还揭示了所有剪枝方法中的一致性结构漏洞:中间层比早期或晚期层对剪枝更敏感。基于这一洞察,我们提出了一种分层稀疏分配策略,在相同的平均剪枝稀疏度下实现了更低的困惑度。在四个模型架构上的实验验证了我们的理论发现。代码在https://github.com/osu-srml/sae-robustness-under-pruning/tree/main上公开。论文稀疏自动编码器大型语言模型剪枝推荐理由:这篇论文探讨了剪枝对稀疏自动编码器在LLMs中鲁棒性的影响,提出了新的剪枝策略,值得AI领域研究者关注。原文稍后读已读值得跟进有用关注 稀疏自动编码器
09:24官方一手arXiv: DeepSeek@Dung Le Quang, Dong Cao Van, Nam Le Hai, Linh Ngo Van, Anh M. T. Bui, Phuong T. NguyenXREPOTEST是一个针对大型语言模型的多语言仓库级单元测试生成基准测试,涵盖Rust、Go、Julia、PHP和Ruby五种语言。它使用容器化执行框架和多种上下文增强策略,包括文件级、基于LSP和基于检索的上下文。实验结果表明,独立测试和仓库级测试之间存在显著差距,并揭示了更丰富的上下文和测试可靠性之间的权衡。论文XREPOTEST单元测试生成大型语言模型推荐理由:XREPOTEST提供了针对大型语言模型单元测试生成的挑战性基准,揭示了不同模型在不同上下文下的表现差异,值得研究。原文稍后读已读值得跟进有用关注 XREPOTEST
21:03techcrunch@Tim FernholzQueryStory 获得种子轮融资 600 万美元,计划利用大型语言模型和网络安全知识使 AI 查询更加连贯。AI产品QueryStoryAI 查询连贯性种子轮融资推荐理由:QueryStory 用 600 万美元种子轮融资,让 AI 查询更可信,值得一试。原文稍后读已读值得跟进有用关注 QueryStory
00:31官方一手Hugging Face: Blog(博客/媒体)精选IBM发布Granite 4.2大型语言模型,采用全新架构,提升推理速度20%,降低能耗30%。模型基于Transformer-XL,支持多语言,适用于自然语言处理任务。AI模型Granite 4.2IBM大型语言模型推荐理由:想了解IBM如何构建大型语言模型的读者,Granite 4.2的构建过程值得一探究竟。原文稍后读已读值得跟进有用关注 Granite 4.2
10:03官方账号arXiv cs.LG@Yichen Jiang, Yueqiao Chen, Dongyu LiuConceptTS是一种可解释的预测框架,利用大型语言模型提出相关概念和生成标签规则,将语言模型的领域知识转化为直接监督。该框架将预测组织在命名、可读的概念周围,包含描述历史背景、局部预测区间和完整预测范围的三种互补瓶颈。实验表明,ConceptTS在准确性上与强黑盒基线相当,同时产生具有语义意义的概念激活。论文ConceptTS时间序列预测可解释性推荐理由:ConceptTS利用大型语言模型实现可解释的多变量时间序列预测,提供更直观的预测解释,适合需要理解预测因素的场景。与黑盒基线相比,准确性相当,值得一试。原文稍后读已读值得跟进有用关注 ConceptTS
00:04官方账号Simon Willison’s Weblog(博客/媒体)精选使用编码代理的关键技能是自信地指导他们进行更改,并验证这些更改是否正确应用。有时这需要审查他们所写的每一行代码,但还有其他方法可以达到这个目标。审查每一行代码从未是验证软件更改的最有效方式。技巧代码审查编码代理生成式AI推荐理由:想要提高代码审查效率,可以尝试使用编码代理,它不仅能帮你审查代码,还能以更高效的方式验证更改的正确性。原文稍后读已读值得跟进有用关注 代码审查
10:48官方账号arXiv cs.AI@Narges Ahmadi, Yubo Jiao, Jônatas Augusto Manzolli, Jiangbo Yu, Luis Miranda-Moreno本研究提出了一种三智能体工作流程,结合对话数据收集、结构化数据处理和行为预测。通过聊天机器人管理的图像增强陈述偏好调查收集了学生通勤者在五种预定义天气场景下的出行方式选择,共获得454个受访者-场景观察。使用多项logit模型分析了与天气相关的关联,而逻辑回归和随机森林提供了机器学习基准。评估了九个本地部署的大型语言模型(LLMs),参数量从2亿到35亿不等,在四种零样本提示和上下文条件下进行评估,并通过角色、少量样本和基于视觉的配置进行扩展。随机森林实现了69.6%的五分类准确率,而最佳纯文本零样本LLM达到了69.9%的准确率,无需特定任务调整。习惯性出行信息产生了最一致的收益,专家框架通常优于角色扮演,而当习惯性出行信息不可用时,角色信息最有用。少量样本提示提高了几个模型的预测能力,在少量示例后收益稳定。使用向受访者展示的相同天气图像,最佳基于视觉的配置达到了71.5%的五分类准确率,表明视觉上下文可能为某些模型提供额外的预测信息。总体而言,该研究展示了如何在可审计的多智能体工作流程中协调对话调查、结构化数据处理、传统行为建模、机器学习和多模态LLM预测。论文出行行为建模多模态LLM预测天气敏感需求预测推荐理由:这篇论文提出了一种结合多种数据收集和预测方法的创新工作流程,对于研究出行行为和天气敏感需求预测非常有用,特别是对于想要了解如何将不同技术整合在一起的人来说。原文稍后读已读值得跟进有用关注 出行行为建模
10:34官方一手arXiv: DeepSeek@Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan大型语言模型在代码生成方面取得显著进展,但大多数现有系统假设预定义的仓库架构。Repo0是一个针对零到全代码生成的持续结构演化框架,通过GPT-5 mini和DeepSeek V3.2在RepoCraft的六个真实仓库上评估,Repo0在所有设置中实现了最高的功能覆盖率和通过率,与RPG相比,功能覆盖率提高20.08个百分点,通过率提高29.74个百分点。论文代码生成大型语言模型Repo0推荐理由:Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。原文稍后读已读值得跟进有用关注 代码生成
11:30官方账号arXiv cs.AI@Bushi Xiao, Sarvesh Soni, Daisy Zhe Wang精选大型语言模型在临床文本中部署时,可靠地表达自身不确定性至关重要。现有不确定性量化方法多针对开放域生成,无法在长临床文本中定位到token或片段级别。研究者提出Reverse Probing,首个专为临床摘要设计的不确定性量化框架,直接从已有标注摘要中估计token级不确定性,而非采样新输出。该方法将文本作为探针,从四种内部激活中提取不确定性信号,在两个专家标注的临床数据集上超越八种基线方法,AUPRC提升高达4倍,同时降低推理时间和计算成本。特征分析显示,delta能量和邻域上下文是所有模型中最一致的预测因子,为模型如何内部响应无支持的临床内容提供了可解释的洞见。论文不确定性量化临床文本大型语言模型推荐理由:临床AI部署中,模型能否准确表达不确定性直接关系到患者安全——Reverse Probing让token级不确定性量化首次在临床摘要场景落地,做医疗NLP或AI安全的研究者值得关注。原文稍后读已读值得跟进有用关注 不确定性量化
09:46官方账号arXiv cs.AI@Fernando Ortega, Raúl Lara-Cabrera, Jorge Dueñas-Lerín, Alejandro de la Torre-Luque, Mercé Salvador Robert, Enrique Baca-García精选该研究利用自然语言处理与机器学习技术,将自由文本的精神科诊断描述自动映射到国际疾病分类(ICD)编码。研究基于14.5万条西班牙语精神科描述数据集,比较了从词袋模型、TF-IDF到大型语言模型(如e5_large、BioLORD、Llama-3-8B)等多种文本表示方法。结果显示,基于Transformer的嵌入方法在捕捉隐含语义和医学术语方面显著优于传统方法,其中e5_large模型通过端到端微调取得了0.866的F1_micro最高分。研究强调,将LLM适配到特定临床术语对于克服“长尾”标签分布和精神科话语的固有歧义至关重要。论文NLPICD编码精神科诊断推荐理由:精神科医生和医疗编码员每天面对大量诊断文本,这项研究展示了如何用LLM自动化ICD编码,大幅减轻行政负担。做医疗NLP或临床信息学的团队值得关注其方法。原文稍后读已读值得跟进有用关注 NLP
07:59官方账号NVIDIA AI@NVIDIAAINVIDIA AI 官方推特宣布了 Nemotron 系列模型的完整论文,并推荐用户阅读 @llm_wizard 的详细解读。该论文可能涉及 NVIDIA 在大型语言模型领域的最新进展,包括模型架构、训练方法或性能优化。对于关注 AI 前沿研究和 NVIDIA 技术动态的开发者与研究者,这是一份重要的技术文档。论文NVIDIANemotron论文推荐理由:NVIDIA 的 Nemotron 论文是了解其 LLM 技术路线的一手资料,做模型训练或推理优化的开发者值得仔细研读,配合 @llm_wizard 的解读能更快抓住重点。原文稍后读已读值得跟进有用关注 NVIDIA
21:35官方一手Anthropic: Transformer Circuits(资讯)70°Transformer Circuits 团队发现大型语言模型具备内省能力,能反思自身内部状态。研究通过一系列实验证明,模型在特定条件下可以识别并报告其内部表征,而非仅依赖训练数据中的模式。这一发现挑战了当前对 AI 意识的理解,可能对模型可解释性和安全性产生深远影响。研究还探讨了内省能力与模型规模、训练数据的关系,为未来 AI 自我认知研究开辟新方向。论文内省意识可解释性AI 安全推荐理由:这项研究揭示了 LLM 可能具备自我反思能力,对 AI 安全与可解释性研究者来说,这是理解模型内部运作的关键突破,值得深入阅读。原文稍后读已读值得跟进有用关注 内省意识
19:11官方账号arXiv cs.AI@Tz-Huan Hsu, Jheng-Hong Yang, Jimmy Lin本研究探讨了在构建深度研究系统时,是否仅需词汇检索器BM25配合更强的大型语言模型即可实现高效结果。研究者提出了Pi-Serini搜索智能体,它具备检索、浏览和阅读文档三个工具。在测试集B-Plus上,Pi-Serini搭配gpt-5.5达到了83.1%的答案准确率和94.7%的证据召回率,超过了使用稠密检索的代理。通过调整BM25参数和增加检索深度,答案准确率提升了18.0%,证据召回率提升了11.1%和25.3%。这表明在推理能力更强的LLM辅助下,传统词汇检索仍能发挥重要作用。代码已开源。论文搜索代理检索增强BM25推荐理由:该研究挑战了稠密检索在深度搜索中不可或缺的假设,为构建轻量、高效、不依赖外挂向量库的搜索代理提供了新思路,值得关注推理模型与经典检索技术的结合。原文稍后读已读值得跟进有用关注 搜索代理