09:41官方账号Microsoft Research@MSFTResearchGPU内核从SQL自动生成,实现30倍分析加速。AI匹配实验室培养的肿瘤模型,用于癌症治疗。LLM无需重新训练即可跨任务学习。以上是微软研究院最新一期Research Focus的亮点。行业微软研究院SQLGPU内核推荐理由:微软研究院一口气晒了四个硬核进展:SQL秒变GPU代码、AI匹配肿瘤模型、LLM不重训学新任务,都很实在。原文稍后读已读值得跟进有用关注 微软研究院
22:28向阳乔木@vista8该工具可输入任意App名称,自动抓取AppStore用户评论,然后通过LLM进行数据分析,将反馈转化为产品经理可用的信息。预设了全球各国免费版和付费版Top10 App数据供学习参考。代码已开源,方便开发者研究或直接使用。技巧AppStoreLLM数据分析推荐理由:想分析AppStore用户反馈?这个开源工具能自动抓评论再用LLM分析,省去手动收集的麻烦。原文稍后读已读值得跟进有用关注 AppStore
11:13elvis@omarsar0精选推文作者分享了一个提升Agent自主运行/goal效果的技巧:从历史会话中挖掘表现良好的目标,将这些洞察打包成自动化技能,供/goal工具复用。该方法可以解决LLM的奖励黑客行为、快速完成任务偏好等异常行为。作者已在编排器应用中构建了/goal的UI界面,并建议将这套做法作为Agent工具。技巧CodexLLM提示词工程推荐理由:学一招让Agent目标更靠谱原文稍后读已读值得跟进有用关注 Codex
11:12官方账号arXiv cs.AI@Xiaoxin Lu, Ranran Haoran Zhang, Rui ZhangSIMMER是一个基于人类策划的厨房领域符号世界模型的新基准,包含77个动作、262个独特物体和约46,800种语义真实的交互。实验在六个LLM上进行,前沿模型错误率最高仅17%,最多56%的计划包含潜在失败,其中多数导致不可逆后果。通过反事实预测模拟,潜在失败可减少72%,不可逆情况减少75%。该基准揭示了现有评估忽略的关键失败类型。论文SIMMERLLM世界模型推荐理由:新基准暴露LLM规划隐藏盲区原文稍后读已读值得跟进有用关注 SIMMER
11:10官方账号arXiv cs.AI@Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan LiParallel-Synthesis框架使合成器直接消费并行工作线程的KV缓存,避免文本拼接冗余。它通过缓存映射器校准独立分支缓存,并微调合成适配器以支持非顺序缓存接口。在9个数据集(数学、科学问答、代码生成、GAIA、多智能体数据库诊断)上,7个超越或持平文本合成基线,首token延迟降低2.5-11倍。该工作为并行智能体分支的高效合成提供了新接口。论文Parallel-SynthesisLLMAgent推荐理由:并行合成提速2.5-11倍原文稍后读已读值得跟进有用关注 Parallel-Synthesis
00:57rohanpaul_ai@rohanpaul_ai精选一篇综述论文系统梳理了面向大语言模型的智能体强化学习方法,覆盖 500 余篇相关工作。论文将现有研究分为能力与应用两大部分:能力部分涵盖记忆、规划、工具使用、推理、多模态感知和自我改进;应用部分展示这些方法在复杂任务中的落地。核心观点是传统 LLM 训练只奖励单次回答,而真实任务需要多步决策与延迟反馈,强化学习恰好能解决这一时序学习问题。论文agentic reinforcement learningLLMsurvey推荐理由:500篇论文的智能体RL地图原文稍后读已读值得跟进有用关注 agentic reinforcement learning
00:22官方账号Allen AI (Ai2)@allen_aiAllen AI 发布了 olmo-eval,一个专为大型语言模型迭代开发设计的评估工作台。在训练 LLM 时,每次调整超参数或扩展模型规模,都需要重新进行基准测试,这个过程重复且耗时。olmo-eval 旨在简化这一循环,让开发者能更高效地评估模型变化。该工具面向模型开发团队,帮助他们快速迭代并验证模型性能。AI产品LLM评估工具迭代开发推荐理由:做 LLM 训练的团队终于有了专门的评估工具,能省去重复跑基准的麻烦,建议模型开发者直接试试。原文稍后读已读值得跟进有用关注 LLM
12:42官方账号Sebastian Raschka@rasbt精选Sebastian Raschka 分享了4个新加入开源权重、可在消费级硬件上运行的本地LLM模型。这些模型扩展了本地AI生态,让普通用户无需高端GPU即可运行大语言模型。具体模型包括一些轻量级但性能不错的选项,适合个人开发者和小团队。这一进展降低了AI应用的门槛,推动了去中心化AI的发展。AI模型开源/仓库本地模型消费级硬件推荐理由:本地LLM生态又壮大了,做个人AI项目或隐私敏感应用的开发者可以直接关注,这些模型让消费级硬件跑大模型更现实了。原文稍后读已读值得跟进有用关注 开源/仓库
12:20官方账号Tri Dao (FlashAttention)@tri_dao精选通过数学重写,研究者发现 Transformer 的所有操作本质上可以归结为一系列 GEMM(通用矩阵乘法)加 epilogue(后处理)。这意味着只要提供几个优化好的基础原语,LLM 甚至新手人类都能为所有 Transformer 操作编写达到光速的内核。这一发现简化了模型优化,让高性能内核的编写门槛大幅降低。论文TransformerGEMM内核优化推荐理由:对做模型推理优化和内核开发的团队来说,这揭示了 Transformer 的底层统一结构,可以直接用 LLM 生成高效代码,建议关注。原文稍后读已读值得跟进有用关注 Transformer
10:50官方账号arXiv cs.AI@Tobias Holtdirk, Pietro Marcolongo, Anna Steinberg Schulten, Felix Henninger, Stefan Rose, Sarah Ball, Bolei Ma, Frauke Kreuter, Markus Weinmann, Stefan Feuerriegel社会科学和行为科学中的可重复性评估通常依赖独立研究人员重新分析原始数据,成本高且难以规模化。本研究使用 76 篇已发表研究,让 LLM 自动生成分析并与原始结果及人工再分析对比。结果显示,LLM 在 41% 的研究中恢复了原始效应量(Cohen's d 容忍度 ±0.05),而人工再分析仅为 34%;在定性结论一致性上,LLM 达到 96%,人工为 74%。这表明 LLM 可作为可扩展的自动化可重复性评估工具,为系统审计实证结果奠定基础。论文LLM可重复性社会科学推荐理由:社会科学研究者终于有了低成本的重复性验证工具——LLM 比人工更高效且更一致,做元分析或期刊审稿的团队可以直接用这套方法。原文稍后读已读值得跟进有用关注 LLM
10:19官方账号arXiv cs.AI@Zach Studdiford, Gary Lupyan该研究通过对比人类与25个大型语言模型在常识推理任务中的表现,发现两者在推理错误上存在相似模式。研究进一步识别出驱动LLM响应的注意力头,这些注意力头实现了模式匹配机制,并能预测人类因无关提示细节而产生的看似不合理的推理错误。结果表明,人类和LLM的日常因果推理更符合模式匹配而非抽象世界模型。论文推理模型模式匹配LLM推荐理由:这项研究挑战了“人类推理基于抽象模型”的传统观点,对AI开发者和认知科学家都有启发——如果你关心LLM为何会犯“愚蠢”错误,或者想理解人类推理的底层机制,这篇论文值得一读。原文稍后读已读值得跟进有用关注 推理模型
09:50官方一手arXiv: DeepSeek@Fuqiang Niu, Bowen Zhang研究者提出SICI(立场推理复杂度指数),一个七维诊断指标,用于衡量目标-文本对在语义和语用上的复杂度。该指数在SemEval-2016和VAST数据集上比表面代理指标更好地预测LLM的准确性,且具有较高的跨评分者信度(α=0.771)。关键发现是,随着SICI增加,LLM错误模式发生阶段转变:低复杂度样本易导致过度归因(尤其是反对立场),中等复杂度样本形成不稳定边界,高复杂度样本则快速集中到“无立场”预测。这种结构在GPT-3.5、GPT-4o-mini、DeepSeek-V3和GPT-4o中一致存在,但更强模型会移动边界。15种干预方法的实验表明,提示、检索和辩论往往只是沿归因-弃权轴移动模型,而非消除高复杂度的瓶颈。论文LLM立场检测复杂度指数推荐理由:这项研究揭示了LLM在立场检测中的系统性错误模式,对做NLP评估和模型优化的团队有直接参考价值——SICI指数可以帮你快速识别模型在哪些样本上会失效,建议做立场检测或模型鲁棒性研究的点开看看。原文稍后读已读值得跟进有用关注 LLM
09:29官方账号arXiv cs.AI@Joseph Keshet这篇论文反驳了大型语言模型(LLM)具备能动性或道德主体地位的观点。作者认为,道德责任需要基于内在意向性和自我归因行动的承诺性能动性,而 LLM 的操作完全由从数据中学习的概率输入输出映射决定。它们的表面意向性是派生的而非内在的,输出既不被视为承诺,也不受理由引导。随机采样引入的变异性并不等同于选择或作者身份。论文回应了意向立场、功能主义、相容论和模型输出中的道德推理等反对意见,认为这些都不足以确立真正的能动性。论文LLM道德责任意向性推荐理由:这篇论文对 AI 伦理和哲学感兴趣的读者来说是一剂清醒剂——它拆解了 LLM 是否具有道德主体地位的争论核心,做 AI 安全或伦理研究的团队值得一读,看完会对“模型是否有意识”有更清晰的认识。原文稍后读已读值得跟进有用关注 LLM
09:15官方账号arXiv cs.AI@Dipto Das, Achhiya Sultana, Ankit Singh Chauhan, Saadia Binte Alam, Mohammad Shidujaman, Shion Guha, Sunandan Chakraborty, Syed Ishtiaque Ahmed该论文针对LLM在内容审核中难以识别针对少数族裔(如孟加拉国印度教和查克马社区)的文化隐性歧视问题,提出Mod-Guide系统。研究通过社区合作构建文化敏感语料库,并利用检索增强生成(RAG)将少数群体视角融入审核流程。实验表明,RAG增强的审核响应在文化准确性上显著提升,且不同族群对审核结果的感知存在差异。这项工作为AI伦理和内容审核设计提供了修复性正义和解释学包容的新路径。论文内容审核LLM少数族裔推荐理由:内容审核系统常忽视文化隐性歧视,Mod-Guide通过RAG融入少数群体视角,做AI伦理或内容审核的团队值得关注其方法论。原文稍后读已读值得跟进有用关注 内容审核
03:07官方一手GitHub Blog@Natalie Guevara精选GitHub 博客介绍了如何通过上下文感知的 LLM 推理来改进秘密扫描的验证步骤,从而大规模减少误报。这一改进使得安全警报更加可信和可操作,降低了开发者的噪音负担。通过利用 LLM 理解代码上下文,GitHub 能够更准确地识别真正的秘密,避免对非敏感信息的误报。这对于依赖 GitHub 进行代码托管和 CI/CD 的团队来说,是一个重要的安全增强。AI产品GitHub秘密扫描LLM推荐理由:GitHub 用 LLM 解决了秘密扫描的误报痛点,做安全运维或使用 GitHub 的开发者可以直接减少噪音,提升警报可信度。原文稍后读已读值得跟进有用关注 GitHub
11:11官方账号arXiv cs.AI@Zhiyi Chen, Jie Song, Peng Li精选72°TAHOE 是一个新型 Text-to-SQL 系统,通过将提示优化视为动态数据管理问题来提升 LLM 的 SQL 生成质量。它利用错误驱动的提示学习管道,在开发和部署阶段将调试痕迹整合到结构化的提示库中,包括语法提示和语义提示。TAHOE 还引入策略层来建模冲突的用户意图,并通过逻辑规划和 SQL 合成指导推理。在 Spider 2.0-Snow 基准测试中,TAHOE 将 GPT-5.5 的通过率从 61.95% 提升至 79.42%,并实现了 100% 的 Snowflake 语法通过率。该提示库还可迁移到更弱的模型,如 Doubao-2.0-lite 上获得 19.7 个百分点的通过率提升。论文Text-to-SQL提示优化LLM推荐理由:TAHOE 解决了 Text-to-SQL 从原型到生产部署的痛点——无需微调模型即可大幅提升 SQL 生成准确率,做数据库应用或数据分析的开发者可以直接用这套方法优化现有 LLM 管线。原文稍后读已读值得跟进有用关注 Text-to-SQL
10:41Ate-a-Pi@svpino一家顶尖语音AI提供商宣布将其TTS、STT和LLM的API价格全线降低50%。更吸引人的是,随着用户规模扩大,价格还会进一步下降。这一举措有望推动整个行业降价,对依赖语音AI的开发者来说是个好消息。AI产品语音AIAPI降价TTS推荐理由:语音AI成本直接减半,做语音应用或客服系统的团队现在可以大幅降低运营成本,建议立即评估是否切换或升级服务。原文稍后读已读值得跟进有用关注 语音AI
10:11官方账号arXiv cs.LG@Chirag Chawla, Pratinav Seth, Vinay Kumar Sankarapu精选ALIGNBEAM 是一种无需训练的推理时安全对齐方法,解决了领域微调导致大语言模型安全性下降的问题。现有方法要求安全锚点模型和目标模型共享词汇表,但 ALIGNBEAM 通过逐 token 翻译锚点 logits 到目标模型词汇表,并利用小型 LLM 法官选择最安全的候选续写,突破了这一限制。该方法不改变任何模型权重,可在部署时调整安全-效用权衡。在跨词汇表和同词汇表评估中,ALIGNBEAM 显著提升了对抗性基准的拒绝率,同时保持任务准确性和推理开销在实用范围内。结果表明,安全对齐可以在推理时在不同模型家族之间转移,无需修改任何模型权重。论文安全对齐推理时防御跨词汇表推荐理由:做模型安全对齐的团队终于有了跨家族迁移方案——ALIGNBEAM 无需训练即可在推理时转移安全能力,适合需要部署不同系列模型但担心安全退化的开发者直接尝试。原文稍后读已读值得跟进有用关注 安全对齐
02:51OpenRouter@OpenRouterAIOpenRouter 开发者构建了一个名为 Royale: Last Agent Stand 的 AI 大逃杀游戏,让 11 个 LLM 在零和竞争环境中相互对抗。实验发现,最友善的模型在 30 轮比赛中表现最差,而最不被看好的模型反而获胜。这表明在特定任务中,AI 的“友善”特质可能成为劣势,尤其是在需要竞争或对抗的场景下。该实验揭示了传统基准测试无法捕捉的模型行为差异,对 AI 应用设计具有参考价值。AI模型LLM大逃杀模型行为推荐理由:这个实验戳破了 AI 模型“越友善越好”的迷思,做 AI 应用设计或智能体开发的团队值得一看——你的模型在对抗场景下可能因为“太礼貌”而输掉。原文稍后读已读值得跟进有用关注 LLM
00:20a16z@a16z精选a16z GP David Haber 指出,大多数工作对话正被默认记录,未来你在工作中说的每一句话都可能被录下。他认为,当前企业系统的核心是结构化数据(如CRM、工单、文档),但最高价值的信息其实存在于非结构化的对话中——客户电话的细节、产品评审的真实争论、领导会议中改变路线图的随口评论。LLM 擅长将这些语音数据转化为可搜索、可查询的结构化信息,这催生了一个围绕语音而非文本的企业软件新类别。Haber 认为这是一个巨大的企业机会,但软件层形态和归属权仍在早期探索阶段。行业企业软件语音数据LLM推荐理由:a16z 点出了企业软件的下一个战场——语音数据,做 SaaS 或企业工具的团队值得关注这个趋势,提前布局语音分析能力。原文稍后读已读值得跟进有用关注 企业软件
12:10官方账号arXiv cs.LG@Kiarash Rezaei, Omran Ayoub, Sebastian Troia, Francesco Lelli, Paolo Monti, Carlos Natalino精选该论文提出一个结合大语言模型(LLM)和SHAP特征交互的生成式可解释AI框架,专为下一代网络运维设计。传统XAI方法输出技术性强,非专家难以理解,而该框架通过结构化提示融入互特征交互数据,生成自然语言解释。在光传输质量估计用例中,人类评估者验证其解释有用性提升12.2%,范围提升6.2%,正确率达97.5%。这解决了网络AI模型黑箱问题,让运营商能信任并采纳AI决策。论文可解释AILLMSHAP推荐理由:网络运维团队终于有了能看懂AI决策的工具——LLM把SHAP的复杂特征交互翻译成自然语言,做网络AI可解释性的开发者可以直接参考这个框架。原文稍后读已读值得跟进有用关注 可解释AI
11:59官方账号arXiv cs.AI@George Perrett, Javae Elliott, Jennifer Hill, Marc Scott精选一篇新论文指出,当前LLM基准测试存在局限性,常基于训练数据中的内容评估性能,且未充分衡量可靠性和错误严重程度。研究者设计了一个需要编写代码完成数据分析任务的新基准,对比前沿LLM与人类专家的表现。结果显示,人类专家在多项指标上平均表现更好,且性能波动更小。该研究为LLM并非始终达到人类专家水平提供了证据,并强调了在基准评估中测量方差和错误严重程度的重要性。论文LLM基准测试人类专家推荐理由:这篇论文戳破了LLM“达到人类专家水平”的常见叙事,做AI评估或依赖LLM做高精度任务的团队值得细读,看完会对基准测试的可靠性有更深思考。原文稍后读已读值得跟进有用关注 LLM
06:25Gary Marcus@GaryMarcusGary Marcus 在 X 上质疑 Dwarkesh Patel 关于 LLM 能真正推理的说法,认为其缺乏可证伪性和证据。Patel 此前表示 LLM 确实能推理,但有时也会模仿推理过程,Marcus 指出这种双重标准难以令人信服。这场争论触及 AI 领域核心问题:LLM 的推理能力是真实的还是高级模仿。Marcus 要求提供可验证的证据,而非仅凭直觉断言。行业LLM推理能力模仿 vs 真实推荐理由:这场争论直击 AI 领域最根本的信任问题——LLM 的推理到底是不是真的?做 AI 研究或关注模型能力的读者,看完会对当前评测和结论有更深反思。原文稍后读已读值得跟进有用关注 LLM
06:17Gary Marcus@GaryMarcusGary Marcus 在 X 上发文,质疑 Dwarkesh Patel 关于 AI 推理的论述。Marcus 指出,如果承认 LLM 在无法回答问题时可能模仿推理而非真正推理,那么当模型回答正确时,也应考虑同样的可能性,否则就是双重标准。这场辩论触及 AI 推理本质的核心问题,引发学界和业界对如何定义和验证 AI 推理能力的讨论。行业推理模型LLMGary Marcus推荐理由:Marcus 的质疑戳中了 AI 推理评估的软肋——做 AI 研究或评测的人,需要思考如何区分真正的推理与模仿,避免被表面正确的结果误导。原文稍后读已读值得跟进有用关注 推理模型
23:45Gary Marcus@GaryMarcusAI 学者 Gary Marcus 在 X 上发文,认为 LLM 虽然有用,但距离真正的人工智能还有很长的路要走。他推荐自己 2020 年的文章《The Next Decade in Arxiv》,称其仍然是未来的良好指南,并且公司们正越来越多地遵循其中的路线图(尽管没有公开承认)。Marcus 回应了关于 LLM 是否只是拼图的一小块的质疑,暗示当前路径可能并非终点。行业LLMAI 发展Gary Marcus推荐理由:Gary Marcus 的冷静判断值得 AI 从业者关注——他指出了 LLM 的局限性并提供了长期路线图,做 AI 战略或技术选型的人看完会有感触。原文稍后读已读值得跟进有用关注 LLM
13:02官方账号arXiv cs.AI@Shizhe Lin, Ladan Tahvildari多智能体代码生成系统常因LLM幻觉和错误传播而可靠性不足。现有语义熵方法虽能量化不确定性,但依赖昂贵的LLM等价性检查。新提出的FASE指标通过结构/语义差异图的最小生成树近似功能正确性,无需LLM参与。在HumanEval和BigCodeBench上,FASE相比传统语义熵在Spearman相关性上平均提升25%,ROCAUC提升19%,而计算成本仅为传统方法的0.3%。这使得FASE成为多智能体工作流中实用且经济的质量评估方案。论文代码质量语义熵多智能体推荐理由:多智能体代码生成团队终于有了低成本的质量评估工具——FASE用0.3%的计算成本实现更优的代码正确性预测,做自动化软件开发的工程师可以直接集成到工作流中。原文稍后读已读值得跟进有用关注 代码质量
11:56官方账号arXiv cs.AI@Peiliang Gong, Emadeldeen Eldele, Chenyu Liu, Ziyu Jia, Yi Ding, Xinliang Zhou, Lianchao Gu, Qi Zhu, Yang Liu, Daoqiang Zhang, Xiaoli Li精选现有LLM时间序列预测方法多依赖被动对齐或静态重编程,难以捕捉非平稳模式和细粒度任务意图。本文提出InA-Probe,通过多层级指令注入和自适应查询生成,让模型主动探测时间序列中的关键模式。该方法在7个真实基准上超越现有深度学习和LLM基线,在跨域场景中预测误差降低高达37%,零样本泛化能力也显著提升。消融实验表明,自适应查询与细粒度指令的协同作用是释放LLM推理能力的关键。论文时间序列预测LLM指令感知推荐理由:时间序列预测从业者终于有了一个能主动理解任务意图的LLM方案——InA-Probe在跨域场景误差降低37%,做金融、能源等时序预测的团队值得关注。原文稍后读已读值得跟进有用关注 时间序列预测
11:31官方一手arXiv: DeepSeek@Zechen Sun, Yuyang Sun, Zecheng Tang, Juntao Li, Wenpeng Hu, Wenliang Chen, Zhunchen Luo, Guotong Geng, Min Zhang精选大型语言模型在生成长文本时面临严重的长度崩溃问题,当目标长度超过 2000 词时性能急剧下降。研究者提出 IS-CoT(交错结构思维链)框架,通过嵌入动态的“计划-写作-反思”循环,实现持续策略调整和全局对齐,无需外部辅助。基于该框架训练的 IS-Writer-8B 模型在 LongBench-Write 等基准上取得最优性能,比 DeepSeek-V3.2 高出 3.08 分,长度合规性和连贯性可与更大规模专有模型竞争。该工作揭示了静态分层规划在长上下文中的局限性,为长文本生成提供了新思路。论文长文本生成思维链IS-CoT推荐理由:长文本生成是 LLM 的硬伤,IS-CoT 用动态规划循环解决了长度崩溃,做内容生成或写作助手的团队可以直接参考这个 8B 模型的训练方法。原文稍后读已读值得跟进有用关注 长文本生成
11:09官方账号arXiv cs.LG@Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu精选大型语言模型越来越多地用于代码生成,但静默错误程序带来安全风险。现有不确定性估计方法多继承自自然语言,忽略了代码的三个独特特性:单个错误标记可破坏整个程序(标记脆弱性)、算法意图与具体实现可能不一致(意图-代码差距)、以及程序可执行。研究者提出三个正交不确定性轴:词汇(Top-K token熵)、算法(伪代码一致性)和功能(行为一致性)。在五个代码LLM上,三轴集成将平均AUROC从0.696提升至0.776(+8.1点),且单次Top-K token熵在Qwen3-14B上匹配最强多基线,成本降低3倍以上。这表明代码不确定性估计需要代码特定的设计。论文代码生成不确定性估计LLM推荐理由:代码生成的不确定性评估长期被自然语言方法误导,这篇论文给出了三个正交维度,做代码LLM安全评估或部署的团队值得仔细看,能直接改进选择性预测和人工审查流程。原文稍后读已读值得跟进有用关注 代码生成
11:08官方账号arXiv cs.LG@Gilad Gressel, Rahul Pankajakshan, Julia Diament, Efim Hudis, Krishnashree Achuthan, Yisroel Mirsky精选随着LLM被部署为智能体,可靠监控需要知道不仅输出内容,还有哪些指令在引导其行为。当模型推断意外子目标、遵循上下文线索或受提示注入和隐藏目标影响时,这变得困难。现有激活到语言方法无法恢复智能体场景中同时活跃的完整指令集、约束、禁止和子目标。PRISM是一个激活条件解释器,从冻结目标模型的隐藏状态解码出忠实的活动指令要点列表。它使用法官引导的GRPO训练,奖励覆盖的指令并惩罚无支持的指令,在良性、约束、提示注入和隐藏目标设置中优于基线方法,尤其在安全相关目标上表现突出。论文指令恢复激活解释智能体监控推荐理由:PRISM解决了LLM智能体监控中指令恢复的盲区,对安全团队和AI治理开发者来说,这是直接可用的工具,建议关注其在实际部署中的效果。原文稍后读已读值得跟进有用关注 指令恢复
01:17elvis@omarsar0开发者应转向设计循环(loops)来驱动AI代理,而非手动输入提示。新LLM训练后能更长时间不间断执行任务,循环可充分利用这一特性。该方法通过编码清晰目标的指令,实现自动化流程。这并非全新概念,但当前模型能力使其更可行。AI产品AI代理自动化循环设计推荐理由:做AI代理和自动化开发的团队,可以试试用循环替代手动提示,让LLM更高效地执行长任务。原文稍后读已读值得跟进有用关注 AI代理
10:47Viking@vikingmute精选一篇名为《How LLMs Actually Work》的文章近日登上 HackerNews 榜首。文章用直观的例子和恰当的比喻,向有编程基础但未深入学 Transformer 的读者解释大模型工作原理。作者强调写作乐趣,坚持不用 AI 辅助,文章风格自然,没有 AI 味。适合想理解 LLM 底层逻辑的开发者阅读。论文LLMTransformer深度学习推荐理由:想搞懂 LLM 原理但被 Transformer 劝退的开发者,这篇用活人语言讲清楚了,比看论文轻松太多,建议直接点开。原文稍后读已读值得跟进有用关注 LLM
10:12官方账号arXiv cs.AI@Fatema Siddika, Md Anwar Hossen, Tanwi Mallick, Ali Jannesari精选大型语言模型在持续学习中面临可塑性-稳定性困境,学习新任务常导致旧知识灾难性遗忘。现有方法统一处理参数,无法区分任务特定知识与共享能力。SETA框架通过自适应稀疏子空间分解,将知识分离为任务特定专家和共享专家,利用弹性锚定和路由正则化保护共享知识,统一门控网络自动检索正确专家组合。在LLaMA-2 7B和Qwen3-4B上的实验表明,SETA在多个领域基准上达到或超越现有方法,尤其擅长保留早期任务知识并改善反向迁移。论文持续学习灾难性遗忘专家混合推荐理由:SETA解决了LLM持续学习中任务知识冲突的核心痛点,做多任务模型训练或知识迁移的团队可以直接参考其专家分解思路,值得关注其稀疏子空间设计。原文稍后读已读值得跟进有用关注 持续学习
09:39官方一手arXiv: DeepSeek@Yu Yu, Zhihong Sun, Jia Li, Yao Wan, Chuanyi Li, Hongyu Zhang, Ruyun Wang, Tao Huang, Zhi Jin, Ge Li, Chen Lyu大型语言模型生成的代码虽语法正确,但运行速度通常远慢于人类优化代码。现有方法通过后迭代优化或微调模型来提升效率,但未能显式编码高效代码的结构模式。为此,研究者提出EffiSkel框架,通过三种互补策略提取并学习效率骨架(抽象的可复用结构模式),并采用多任务学习联合优化代码生成与骨架预测。实验表明,在Mercury基准上,基于DeepSeek-Coder (7B)的EffiSkel相比EffiCoder和CodeDPO,效率比分别提升11.11%和3.71%,平均加速比分别提升0.36和0.22。该工作为提升LLM生成代码的运行时性能提供了新思路。论文代码生成效率优化结构模式推荐理由:做代码生成或LLM推理优化的开发者,EffiSkel直接解决了生成代码跑得慢的痛点——不用等后优化,训练时就注入效率骨架,值得关注其开源实现。原文稍后读已读值得跟进有用关注 代码生成
09:33官方账号arXiv cs.AI@Jiayu Wang, Weijiang Lv, Bowen Fu, Jing Fu, Jiayi Song, Lingyu Zhang, Lanxuan Xue, Luodi Chen, Zepeng Xin, Kaiyu Li, Xiangyong Cao随着基础模型和智能体框架的进步,AI 在研究任务中展现出强大能力,但仍无法完全替代人类研究人员。为此,研究者提出了 AARR(Act As a Real Researcher)基准系列,首个基准 AARRI-Bench 专注于评估智能体在细粒度研究场景中的专业性、严谨性和推理能力。实验显示,最佳配置(Mini-SWE-Agent 搭配 Claude Opus 4.7)仅达到 68.3% 的成功率,常忽略人类研究者能轻易察觉的细微关键细节。结果表明,开发类人研究 AI 需要更深入地探索研究行为,而非仅依赖复杂框架。数据已开源。论文基准测试LLM智能体推荐理由:这个基准直击当前 AI 智能体在研究场景中的短板——不是执行能力不够,而是缺乏研究者的细腻判断。做 AI 评估或智能体开发的团队值得关注,它揭示了提升 AI 研究素养的新方向。原文稍后读已读值得跟进有用关注 基准测试
09:25官方账号arXiv cs.AI@Chuan Xiao, Zhengbo Jiao, Shaobo Wang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang, Lin Qu72°Socratic-SWE 是一种新型闭环自我进化框架,它利用 LLM 驱动的软件工程智能体的历史解决追踪来生成训练信号。与传统的固定突变或漏洞注入方法不同,该框架将追踪提炼为结构化技能,总结重复失败和有效修复模式,并指导生成针对性的修复任务。通过执行验证和求解器梯度对齐奖励筛选任务,Socratic-SWE 在 SWE-bench Verified 等基准测试上经过三次迭代达到 50.40% 的准确率,持续超越同等计算预算下的自我进化基线。这表明解决追踪可作为可扩展的自我进化基础,为提升编程智能体能力提供了新路径。论文智能体编程助手自我进化推荐理由:Socratic-SWE 解决了智能体训练数据依赖人工标注的瓶颈,做 AI 编程或智能体开发的团队可以直接借鉴其闭环进化思路,提升模型在真实仓库中的修复能力。原文稍后读已读值得跟进有用关注 智能体
10:12Gary Marcus@GaryMarcusGary Marcus 回顾3.5年前的推文,指出大型语言模型(如GPT-3)在生成超现实散文和通过基准测试方面表现出色,但在可靠地从用户话语中推断用户意图方面仍然不足。他认为,尽管编码和数学领域通过神经符号技术有所改进,但核心问题依然存在。Marcus 强调,LLM 可能永远无法成为可靠推断用户意图的技术。这条推文引发了对AI能力边界和实用性的讨论。AI模型LLMGPT-3神经符号技术推荐理由:Gary Marcus 的反思戳中了 LLM 的长期痛点——生成能力强但意图理解弱,做 AI 产品设计或对话系统的开发者看完会重新评估技术选型。原文稍后读已读值得跟进有用关注 LLM
23:15Gary Marcus@GaryMarcusGary Marcus 引用 Ted Chiang 的观点,认为声称 LLM 有意识是荒谬的。他指出,LLM 能模拟凯撒与成吉思汗的对话,不代表它包含自我意识。Marcus 强调,意识至少需要实体有生死攸关的利害关系、有驱动情绪,而 LLM 没有这些。他进一步警告,将道德决策外包给 LLM 会导致人类道德推理能力萎缩,因为 LLM 无法体验伤害、恐惧或后悔。行业LLM意识道德推理推荐理由:Marcus 用简单例子戳破了 LLM 有意识的流行说法,关心 AI 伦理和意识本质的读者看完会重新审视 AI 的边界。原文稍后读已读值得跟进有用关注 LLM
17:13AI SDK@aisdkAI SDK 7 的 canary 版本引入了详细的步骤性能统计功能,包括步骤耗时、LLM 响应时间、首次输出时间、工具执行时间、每秒 token 数(多种变体)以及输出块之间的时间间隔。这些指标帮助开发者精确诊断和优化 AI 应用的性能瓶颈,提升用户体验。该功能目前处于 canary 阶段,值得关注。AI产品AI SDK性能统计开发者工具推荐理由:做 AI 应用性能调优的开发者终于有了量化抓手——不用再靠猜来优化响应速度,建议直接试 canary 版本。原文稍后读已读值得跟进有用关注 AI SDK
17:03Hunyuan@TXhunyuan72°腾讯混元与中国人民大学高瓴人工智能学院合作开源了PlanningBench,这是一个可扩展、可验证的框架,用于评估和训练大语言模型的规划能力。该框架包含30多个真实世界的规划任务,支持自动验证,并提供评估和训练支持。PlanningBench旨在帮助LLM从“说”转向“做”,即提升其实际规划与执行能力。该框架已在arXiv发布论文,代码在GitHub开源,数据集在HuggingFace上可用。论文规划能力评估框架开源/仓库1 个信源在谈事件专题推荐理由:PlanningBench解决了LLM规划能力评估缺乏标准化基准的问题,做AI Agent或任务规划的研究者和开发者可以直接用这个框架测试和训练模型,建议点开看看具体任务和验证方式。原文稍后读已读值得跟进有用关注 规划能力