08:36berryxia@berryxia一位开发者分享使用YOLO模型进行人体形体动作识别的项目经验,指出传统模型参数虽小,但结合LLM后能拓展应用场景。这种组合方式在保持轻量化的同时,利用LLM的语义理解能力提升动作识别的准确性和灵活性。对于需要低成本实现复杂动作分析的团队,这是一个值得尝试的方向。AI产品YOLOLLM人体动作识别推荐理由:做动作识别或边缘AI的开发者,YOLO小模型+LLM的组合能低成本提升识别效果,建议试试这个思路。原文稍后读已读值得跟进有用关注 YOLO
12:12官方一手arXiv: OpenAI@Jiwon Kim, Claire Wang, Taeung Yoon, Sabelle Huang, Koustuv Saha精选大型语言模型(LLM)越来越多地被用于情感支持和正式治疗场景,但像ChatGPT或Llama等模型内置的内容审核机制会阻止它们讨论敏感话题,这可能影响其作为治疗师的能力。本研究对OpenAI、Meta和Google的三种先进审核系统进行了算法审计,评估它们对真实治疗对话内容的标记程度。结果显示,这些系统过度标记了治疗中必要的敏感内容,揭示了LLM在扮演治疗师角色时面临的限制。这对设计用于心理健康的AI系统具有重要启示,表明当前审核机制可能阻碍有效的治疗对话。论文LLM内容审核心理健康9 个信源在谈事件专题推荐理由:这项研究戳穿了AI治疗应用的核心矛盾——安全审核反而成了障碍,做心理健康AI产品、设计对话系统的团队值得细读,看完会对审核策略有新的思考。原文稍后读已读值得跟进有用关注 LLM
11:50官方一手arXiv: Anthropic@Alfredo Pesoli, Herman Errico, Lorenzo Cavallaro精选本文从“漏洞经济学”视角分析LLM驱动的漏洞发现对攻防格局的影响。传统上,高端零日漏洞是政府、经纪商和攻击性厂商的昂贵专业产出,而LLM辅助系统降低了候选漏洞生成、代码理解、验证报告等环节的成本。这导致瓶颈从“发现更多漏洞”转向“吸收、验证、分类、修补和发布大量报告”。基于Anthropic Mythos Preview与Mozilla Firefox合作数据,论文指出近期变化不是更多零日漏洞,而是防御者修复吞吐量的提升:低信号候选漏洞变便宜,证据丰富的修复更重要,稀缺能力转向维护者审查和发布。开源项目受影响最严重,因为LLM辅助发现可增加报告量,但维护者验证、分类、资金和发布能力可能无法同步扩展。论文LLM漏洞发现安全经济学5 个信源在谈事件专题推荐理由:这篇论文戳破了“AI将颠覆安全攻防”的简单叙事,用经济学框架解释了为什么防御者才是LLM漏洞发现的真正受益方。做安全运营、开源维护或漏洞奖励计划的人,看完会重新理解自己的瓶颈在哪。原文稍后读已读值得跟进有用关注 LLM
11:46官方账号arXiv cs.AI@Yunhua Pei, Jingyu Hu, Yiwei Shi, Hongnan Ma, Weiru Liu, John Cartlidge精选StakeBench 是一个新的金融 NLP 评估框架,它通过分析 Polymarket 和 Manifold 预测市场上 2,261 个已结算市场的 560,876 条评论,将语言理解与市场承诺(如持仓方向、交易行为、赔率轨迹)挂钩,而非传统的人工标注情感。该框架包含四个诊断任务:检测市场承诺、识别持仓方向、预测未来交易行为以及集体赔率预测。实验发现,15 个 LLM 在方向识别上表现参差不齐(准确率 0.506-0.599),但在未来行动预测和赔率预测上普遍失败,且模型规模与性能无关,金融领域微调也无帮助。StakeBench 的代码和数据集以 CC-BY 4.0 协议开源。论文金融NLP市场承诺评估基准推荐理由:金融 NLP 从业者终于有了一个基于真实市场行为的评估基准,比传统情感分析更贴近交易决策,做金融 AI 的团队值得关注。原文稍后读已读值得跟进有用关注 金融NLP
11:45官方账号arXiv cs.AI@Maoyang Xiang, Bo Wang, Tao Luo精选OrpQuant提出了一种名为正交残差投影(ORP)的算法-硬件协同设计框架,用于解决低比特Power-of-Two(PoT)量化中的低角度分辨率问题。该方法通过双基几何投影自适应合成更高分辨率的残差格点,仅使用移位和加法操作,避免了乘法器。在LLaMA-2-7B上,3比特量化(W3/A16)下困惑度达到6.10,与AWQ等MAC密集型方法相当,且全模型校准仅需约15分钟。在28nm工艺下,RTL综合表明ORP有效缓解了密集乘法器树的时序瓶颈。该工作适用于LLM和ViT的边缘部署。论文量化边缘部署LLM推荐理由:OrpQuant解决了低比特量化中特征流形退化的问题,做边缘部署的开发者可以直接用这个15分钟校准的方案替代传统MAC密集型方法,硬件效率显著提升。原文稍后读已读值得跟进有用关注 量化
06:36rohanpaul_ai@rohanpaul_ai72°Google 新论文指出,大语言模型的幻觉问题根源不在于回答错误,而在于错误时仍显得过于自信。论文提出应将目标从追求完美事实性转向让模型诚实表达自身不确定性,即“忠实的不确定性”。作者认为,模型缺乏的不是知识,而是对自身认知的元认知能力。对于智能体而言,不确定性感知能决定何时搜索、何时信任来源、何时停止,比工具本身更重要。论文LLM幻觉不确定性推荐理由:这篇论文点破了 LLM 幻觉的核心矛盾——不是知识不够,而是不知道什么时候该说“不确定”。做 AI 产品、智能体或对话系统的团队,看完会对“诚实比正确更重要”有更深理解,建议直接读原文。原文稍后读已读值得跟进有用关注 LLM
17:57官方账号Decoder@Matthias Bastian精选著名程序员 George Hotz 在测试 AI 编程智能体六个月后发出警告,认为它们将成为软件开发行业最昂贵的错误之一。他指出,LLM 能快速生成原型,但在细节上漏洞百出,产生的错误越来越难以发现。这一观点反映了 AI 社区在 LLM 角色问题上存在的深刻分歧。Hotz 的批评提醒开发者,在依赖 AI 编程工具时需谨慎评估其长期影响。行业AI 编程智能体LLM推荐理由:Hotz 的警告戳中了 AI 编程工具的痛点——快速原型掩盖了难以调试的细节错误,做软件开发的团队在引入 AI 智能体前值得认真读一读。原文稍后读已读值得跟进有用关注 AI 编程
11:19官方账号arXiv cs.AI@Zhewen Tan, Yilun Yao, Huiyan Jin, Wenhan Yu, Guoan Wang, Mengyuan Fan, liang lu, Feng Liu, Xiangzheng Zhang, Duohe Ma, Tong Yang, Lin Sun精选大语言模型智能体依赖持久记忆来存储历史交互并提升长任务执行能力,但这也带来了安全漏洞:对抗用户可通过正常交互向记忆库注入恶意记录,后续检索时操纵智能体行为。现有防御主要聚焦在线干预(如提示过滤),无法在有害行为发生后定位哪些记忆是罪魁祸首。MemAudit 提出后验因果审计框架,结合反事实记忆影响分数和记忆一致性图,从结构异常中识别恶意记忆。在 QA 和推理智能体场景下,MemAudit 将攻击成功率从 70% 和 83.3% 降至 0%,为智能体记忆安全提供了有效的审计工具。论文智能体安全/对抗记忆审计推荐理由:智能体记忆安全是实际部署中的盲区,MemAudit 解决了「事后追责」的难题,做 LLM 安全或智能体系统的团队可以直接参考其因果审计方法。原文稍后读已读值得跟进有用关注 智能体
11:15官方账号arXiv cs.AI@Laura R. Marusich, Mary Grace Kozuch Dhooghe, Jonathan Z. Bakdash, Murat Kantarcioglu精选一项大规模人类行为实验评估了LLM生成的叙事解释对分类任务决策表现的影响。研究发现,无论叙事解释的说服力高低,其提升决策准确性的效果并不优于仅提供AI预测。叙事解释增加了用户对AI的依赖,但无论AI预测正确与否,这种依赖都会增强。探索性分析还表明,更具说服力的叙事可能延长决策响应时间,并削弱用户区分正确与错误预测的能力。该研究指出,在AI预测中加入叙事解释可能带来决策表现的权衡,需要更多工作来理解其影响机制。论文LLM叙事解释人机决策推荐理由:做AI辅助决策系统或人机协作研究的团队,这篇论文揭示了叙事解释可能带来的隐藏成本——它不一定提升准确率,反而可能拖慢决策并增加盲目信任,值得仔细读读实验设计。原文稍后读已读值得跟进有用关注 LLM
09:55官方账号arXiv cs.LG@Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Roland Aydin, Christian Cyron精选传统本构模型开发需要多年连续介质力学和编程经验,LLM虽能自动生成模型,但单智能体管道缺乏物理一致性检查。研究者提出双智能体框架:Creator智能体根据数据生成模型,Inspector智能体审计模型是否违反9项物理约束,违规则退回修改。在脑组织、实验橡胶和合成橡胶数据集上,使用Claude Opus 4.7和Kimi K2.5测试,Inspector将Opus的物理约束满足率从91%提升至100%,Kimi从37%提升至56%,同时保持高精度和强泛化能力。该框架技术无关,可随LLM能力提升自动扩展,为自动化、物理感知的模型发现开辟新路径。论文本构模型多智能体物理约束推荐理由:做材料本构建模的团队终于有了靠谱的AI助手——双智能体框架自动生成物理有效的模型,省去手动校验的繁琐,建议做固体力学或生物力学仿真的开发者点开看看。原文稍后读已读值得跟进有用关注 本构模型
09:54官方账号arXiv cs.LG@Seyed Bagher Hashemi Natanzi, Pranshav Gajja, Bo Tang, Vijay K. Shah精选O-RAN 架构允许通过模块化的 xApps 和 rApps 将 AI 直接嵌入到无线接入网中,但创建这些应用(数据收集、模型训练、代码编写和安全部署)仍然缓慢且主要依赖人工。大型语言模型(LLM)具备强大的推理和代码生成能力,但不适合实时 RAN 控制所需的快速、确定性推理。本文提出了一种概念验证的“双脑”架构,结合了两种优势:基于 LLM 的编排器将运营商意图转化为数据收集策略和部署代码,而自动化 ML 引擎 NeuralSmith 通过 API 按需训练轻量级分类器。文章描述了架构和部署工作流,分享了来自容器化 O-RAN 5G SA 测试床的实践见解,并讨论了开放的研究方向。论文O-RANLLMAI服务部署推荐理由:O-RAN 开发者终于有了将 LLM 的灵活性与实时推理效率结合起来的可行方案——双脑架构直接解决了 AI 应用部署慢、手动操作多的问题,做 RAN 智能化的团队值得关注这个原型和测试床经验。原文稍后读已读值得跟进有用关注 O-RAN
00:22岚叔@lufzzliz精选一位开发者基于历史实践,沉淀了一套完整的 LLM Wiki 教程,包含 Skill、实践案例和原理解读。教程可直接让 AI Agent 阅读并按照 Skill 进行实操,同时推荐结合 Agent 的定时任务能力实现 Wiki 的持续迭代。该教程旨在帮助用户高效构建和维护 LLM 知识库,适合对 LLM 应用落地感兴趣的团队和个人。AI产品LLMWiki教程推荐理由:做 LLM 知识库搭建的团队可以直接用这套 Skill 实操,配合 Agent 定时任务还能自动迭代,省去手动维护的麻烦。原文稍后读已读值得跟进有用关注 LLM
10:49Gary Marcus@GaryMarcus精选Gary Marcus 在推文中指出,世界模型(world model)并非新概念,已在象棋程序、导航系统、维基百科等系统中存在多年,它们是对对象、地点、事件、机制等可推理内容的显式表示。然而,当前的大语言模型(LLM)缺乏这种显式世界模型。Marcus 强调,大多数世界模型是手工构建的,真正的挑战在于如何从数据中自动获取它们。这引发了关于AI系统如何更好地理解和推理世界的讨论。AI模型世界模型LLM推理推荐理由:Marcus 点出了LLM的核心短板——缺乏显式世界模型,做AI推理和知识表示的开发者值得关注,看完会重新思考LLM的局限性。原文稍后读已读值得跟进有用关注 世界模型
07:06Browser Use@browser_useBrowser Use 团队发布了用 Rust 编写的终端 UI 和浏览器自动化工具 Browser Use Terminal。它直接通过 Chrome DevTools Protocol 控制浏览器,支持 GPT、Claude、Kimi、GLM、Qwen、DeepSeek 等多种 LLM。相比原 Browser Harness,速度提升 2 倍、成本降低一半,且完全开源。用户可以在终端中实时观察、暂停、恢复自动化任务,适合处理繁琐的网页操作。AI产品浏览器自动化RustTUI2 个信源在谈事件专题推荐理由:如果你经常在浏览器里做重复性操作(填表、爬数据、管理权限),这个 Rust 写的 TUI 工具比同类方案快 2 倍还便宜一半,而且支持多种主流 LLM,值得直接上手试试。原文稍后读已读值得跟进有用关注 浏览器自动化
11:26官方账号arXiv cs.LG@Huanchi Wang, Zihang Huang, Yifang Tian, Kristina Dzeparoska, Hans-Arno Jacobsen, Alberto Leon-Garcia精选FAME 提出了一种标签高效的混合专家框架,用于消息级日志异常检测。传统方法在会话或窗口级别检测异常,粒度粗糙,迫使运维人员检查大量常规日志行。FAME 通过离线使用一次大语言模型,为每个模板标注最多 K 行,生成正常/异常指示符和代表性示例,并自动将模板划分为故障域。训练后的轻量路由器和领域专家可在本地运行,输出异常预测和故障域标签。在 BGL 数据集上,FAME 在 K=100 时达到 F1=98.16,标注量减少 76 倍,并检测出 86.3% 的未见 EventID 异常;在 Thunderbird 上达到 F1=99.95 且召回率完美。论文日志异常检测混合专家模型LLM推荐理由:运维团队终于有了兼顾精度和效率的日志异常检测方案——FAME 用一次 LLM 离线标注就解决了消息级检测的痛点,标注量减少 76 倍还能发现未知故障,做日志分析或运维自动化的开发者值得关注。原文稍后读已读值得跟进有用关注 日志异常检测
08:05rohanpaul_ai@rohanpaul_ai83°一项实验表明,通用型大语言模型(LLM)在获得足够测试时计算资源后,能够产生前沿数学研究。具体而言,一个普通的OpenAI模型成功将代数数论与平面几何联系起来,并利用这一桥梁击败了一个存在数十年的猜想。这揭示了前沿模型可能已经包含有用的潜在数学能力,而瓶颈部分在于允许它们思考的时间和方式。该发现对AI在科研领域的应用具有重要意义,表明通过延长推理时间,通用模型也能突破传统局限。论文LLM数学推理前沿研究7 个信源在谈事件专题推荐理由:这项发现打破了“只有专用模型才能做前沿研究”的认知,做AI科研或数学研究的团队值得关注——它意味着你的通用模型可能比想象中更聪明,只是需要给它更多思考时间。原文稍后读已读值得跟进有用关注 LLM
01:41AK@_akhaliqMix-Quant 是一种针对智能体大语言模型(LLM)的量化方法,旨在解决预填充阶段(Prefilling)和精确解码(Precise Decoding)的平衡问题。该方法通过量化预填充来加速推理,同时保持解码阶段的精度,特别适用于需要快速响应和准确输出的智能体应用。Mix-Quant 在保持模型性能的同时,显著降低了计算成本和内存占用,为智能体系统的部署提供了更高效的方案。该技术有望推动智能体LLM在实时交互和资源受限场景中的实际应用。AI模型量化智能体推理优化推荐理由:做智能体LLM部署的团队终于有了兼顾速度和精度的量化方案——Mix-Quant 解决了预填充慢、解码不准的痛点,建议做推理优化的开发者点开看看。原文稍后读已读值得跟进有用关注 量化
09:51Ethan Mollick@emollick精选根据公开的 LLM 资源使用估算,AI 解决一个 Erdos 数学问题仅消耗 0.6-6.3 kWh 电力和 3-31 升水。这相当于电动汽车行驶 2-20 英里的用电量,以及不到三颗杏仁的耗水量。该数据直观展示了 AI 推理的环境成本,引发对 AI 能效与可持续性的讨论。论文AI 能耗环境成本Erdos 问题推荐理由:这个数字对比让 AI 能耗变得可感知——做 AI 研究或关心可持续计算的读者,看完会重新思考模型效率的价值。原文稍后读已读值得跟进有用关注 AI 能耗
09:46官方账号arXiv cs.AI@Gundeep Singh, Parsa Kavehzadeh, Jing Xia, Xue-Yong Fu, Julien Bouvier Tremblay, Md Tahmid Rahman Laskar, Vincent Lum, Shashi Bhushan TN精选传统Text-to-SQL方法在企业环境中面临挑战,因为企业分析依赖受治理的API而非原始数据库。本文提出Analytic Agent,一个基于LLM的智能体系统,能将自然语言意图转化为安全的API交互。该系统通过多步推理和策略感知编排,实现用户目标理解、权限验证、受控查询执行和合规可视化生成。在90个真实企业用例上评估,表现可靠。论文智能体企业分析LLM推荐理由:企业数据分析团队终于有了兼顾安全与易用性的方案——Analytic Agent解决了LLM直接操作数据库的合规风险,做BI或数据治理的开发者值得关注。原文稍后读已读值得跟进有用关注 智能体
08:01Gary Marcus@GaryMarcusGary Marcus 在 X 上发问,质疑一项新的数学成果究竟是结合了 Lean 等工具的神经符号方法,还是纯大语言模型(LLM)的产物。该推文引发讨论,目前有 16 条回复、3 次转发和 30 个赞,浏览量超过 6200。Marcus 的提问反映了 AI 领域对数学推理中符号系统与纯 LLM 方法优劣的持续关注。行业Gary Marcus神经符号Lean推荐理由:Marcus 的质疑切中 AI 数学推理的核心争议——符号系统 vs 纯 LLM,关注 AI 推理能力的读者值得一看,能帮你理解当前研究的分歧点。原文稍后读已读值得跟进有用关注 Gary Marcus
08:01官方账号Simon Willison’s Weblog(博客/媒体)Mike Veerman 开发了一个 HTML 应用,模拟从 5 到 800 tokens/s 的 LLM 输出速度,帮助用户直观感受不同 token 速率下的文本生成效果。当看到模型宣传“30 tokens/s”时,可以用这个工具快速理解实际体验。该工具通过 Hacker News 传播,对评估和比较不同 LLM 的响应速度很有帮助。AI产品LLMtoken 速率可视化工具推荐理由:选模型时经常被 token 速率数字搞晕?这个工具让你直接看到不同速度下的文本生成效果,做模型选型或写提示词优化的开发者值得一试。原文稍后读已读值得跟进有用关注 LLM
08:00官方账号Simon Willison’s Weblog(博客/媒体)精选datasette-llm 0.1a8 版本发布,主要修复了 llm_prompt_context() 钩子未能完整收集链式响应的 Bug。该问题影响使用 LLM 链式调用场景的用户,导致上下文信息丢失。此次更新确保了链式响应能被正确聚合,提升了数据完整性和可靠性。对于依赖 datasette 进行 LLM 交互的开发者来说,这是一个关键修复。AI产品datasetteLLMBug修复推荐理由:如果你在用 datasette 做 LLM 链式调用,这个修复能避免上下文丢失导致的错误输出,建议升级。原文稍后读已读值得跟进有用关注 datasette
08:00官方账号Simon Willison’s Weblog(博客/媒体)datasette-llm-accountant 是一个用于追踪 LLM API 调用成本的 Datasette 插件。最新 0.1a4 版本修复了追踪响应链时的一个 bug,该 bug 影响了对连续对话或链式调用的成本统计准确性。此更新确保用户能正确核算多轮交互的 token 消耗和费用。对于依赖 Datasette 管理 LLM 使用成本的团队,这是一个重要的修复。AI产品LLMDatasette成本追踪推荐理由:用 Datasette 管理 LLM 成本的用户终于不用被链式调用的账单搞糊涂了——这个修复让多轮对话的费用统计更准确,建议升级。原文稍后读已读值得跟进有用关注 LLM
08:00官方账号Simon Willison’s Weblog(博客/媒体)76°llm-gemini 插件更新至 0.32 版本,新增了对 Gemini 3.5 Flash 模型的支持。该模型是 Google 最新推出的轻量级模型,旨在提供更快的推理速度和更低的成本。作者还分享了使用该模型绘制鹈鹕的示例,展示了其生成能力。对于使用 LLM 命令行工具的用户,这次更新意味着可以更方便地调用 Gemini 3.5 Flash 进行文本生成和创意任务。AI产品GeminiLLM模型更新推荐理由:LLM 命令行用户可以直接升级体验 Gemini 3.5 Flash 的快速推理,做创意生成或快速原型验证的开发者值得一试。原文稍后读已读值得跟进有用关注 Gemini
07:59Ethan Mollick@emollick72°2024年6月,通用大模型连草莓里有多少个r都数不清;2025年7月,最新模型已在国际数学奥林匹克竞赛中获得金牌;到2026年5月,模型甚至解决了组合几何中一个著名难题。这一系列对比展示了LLM在数学推理能力上的飞速进步,从基础计数到顶尖竞赛再到前沿研究,仅用两年时间。AI模型LLM数学推理IMO金牌推荐理由:数学推理是AI能力的硬指标,从数不清草莓到IMO金牌再到解决几何难题,这个时间线让所有关注AI能力边界的开发者震撼——建议点开看看,你会对模型进化速度有全新认知。原文稍后读已读值得跟进有用关注 LLM
15:38官方账号arXiv cs.AI@Saurav Ghosh, Gabriella Polach, Abdou Sow精选这篇论文研究了结构化提示设计是否能提升大语言模型的回答质量并减少用户交互成本。研究者对比了三种提示条件:原始提示、清单改进提示和澄清问题提示,在摘要、规划、解释和编程四种任务上测试了ChatGPT、Claude和Grok三个模型。结果显示,清单改进提示的平均评分最高(7.50/8),远超原始提示(5.67)和澄清问题提示(6.67),且使用的token数更少。研究表明,简单的提示清单就能显著提升回答质量并减少不必要的来回交互。论文提示工程结构化提示清单提示推荐理由:做AI提示工程或日常使用LLM的开发者,用清单提示法能直接提升输出质量并省去反复调试的麻烦,建议试试这个简单但有效的技巧。原文稍后读已读值得跟进有用关注 提示工程
11:35官方账号arXiv cs.LG@Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta精选72°最新研究指出,将 LLM 与进化搜索结合的编码智能体在数学发现和算法设计上表现强劲,但进步可能源于多种机制:新算法结构、调整现有策略、重组模型内部知识或过拟合评估器。为区分这些机制,研究者推出了 EvoTrace 数据集,涵盖四种进化框架、推理与非推理模型及 16 个任务。他们开发了 EvoReplay 方法,通过重放分析高分解背后的局部搜索状态,并标注了九种编辑类型。结果发现,大部分得分提升来自少数编辑类型,且约 30% 的代码行是重复引入的已删除行,表明基准进步可能并非真正的新算法结构。论文进化算法编码智能体LLM推荐理由:做 AI 编码智能体或进化算法研究的开发者,这篇论文帮你拆解了 benchmark 分数的真实来源——别再只看最终得分了,EvoTrace 让你看清智能体到底在“进化”什么。原文稍后读已读值得跟进有用关注 进化算法
10:51官方一手arXiv: DeepSeek@Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. Ajila精选研究人员提出一个基于强化学习的框架,将提示词优化建模为序列决策问题。PPO代理通过混合动作空间(直接生成、遗传变异、语义重写)迭代改进提示词,并利用单元测试反馈的奖励信号驱动优化。在MBPP+、HumanEval+和APPS基准上,使用CodeT5+、CodeLLaMA和DeepSeek-Coder作为冻结代码生成器,PPO代理在MBPP+的500任务测试集上分别达到57.58%、64.80%和85.50%的严格Pass@1,优于EPiC、Reflexion和随机混合方法。软Pass@1分别达到67.90%、73.10%和88.20%。结果表明,带形状奖励的强化学习能显著提升LLM代码生成的功能正确性。论文提示词优化强化学习代码生成推荐理由:做LLM代码生成或提示词工程的开发者,这个框架直接解决了提示词敏感性问题——用RL自动优化提示词,比手动调参高效得多,建议关注其混合动作空间和奖励设计。原文稍后读已读值得跟进有用关注 提示词优化
10:49官方一手arXiv: DeepSeek@Adrien Bazoge, Josselin Corvellec, Sofiane Djillali Sid-Ahmed, Pierre-Antoine Gourraud精选一项新研究评估了提示语言对大型语言模型临床诊断推理和最终诊断准确性的影响,比较了英文和法文下五个模型(o3、DeepSeek-R1、GPT-4-Turbo、Llama-3.1-405B-Instruct、BioMistral-7B)的表现。180个临床案例由两位医生使用18分量表评估,涵盖16个医学专科。结果显示,除o3外,其他四个模型在英文提示下表现更好,平均差异0.37-0.91分,差异体现在鉴别诊断、逻辑结构和内部有效性等多个推理维度。这表明提示语言仍是LLM临床性能的关键决定因素,对全球语言文化公平部署具有重要影响。论文LLM临床决策支持多语言推荐理由:医疗AI开发者需要注意:你的模型在非英语场景下可能掉链子,o3是唯一不受语言影响的例外。做多语言临床决策支持的团队,这篇论文值得细读。原文稍后读已读值得跟进有用关注 LLM
10:36官方账号arXiv cs.AI@Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima精选这篇综述系统梳理了大型语言模型在数学推理领域的最新进展,涵盖约120篇论文。文章提出了统一的数学数据集分类法,区分了预训练语料、监督微调资源和评估基准。它分析了推理架构和训练策略(如工具集成、验证器引导推理、参数高效微调)对鲁棒性和泛化能力的影响。比较评估揭示了最终答案准确率与过程级推理验证之间的差距。最后,论文指出了常见失败模式(如推理忠实性问题、基准偏差)和未来研究方向。论文推理模型数学推理综述/论文推荐理由:做LLM推理研究或评估的团队,这篇综述帮你系统梳理了120篇论文的脉络,直接拿来当研究起点,省去大量文献筛选时间。原文稍后读已读值得跟进有用关注 推理模型
08:22官方账号Simon Willison’s Weblog(博客/媒体)精选llm-gemini 0.32a0 版本发布,与 llm>=0.32a0 alpha 兼容。新版本增加了流式传输推理令牌的能力,让用户能实时看到模型的思考过程。这对于需要理解模型推理逻辑的开发者来说是一个重要更新。该版本主要面向使用 Gemini 模型的 LLM 命令行工具用户。AI产品GeminiLLM流式推理推荐理由:流式推理令牌让开发者能实时观察模型思考过程,做 AI 调试或教学演示的团队可以直接升级体验。原文稍后读已读值得跟进有用关注 Gemini
00:20官方账号Andrej Karpathy@karpathy83°AI 领域知名人物 Andrej Karpathy 宣布加入 Anthropic,重返大语言模型前沿研发。他认为未来几年将是 LLM 发展的关键形成期,对此充满期待。Karpathy 同时表示仍对教育保持热情,计划未来继续从事相关工作。这一消息引发社区广泛关注,被视为 Anthropic 在 AI 人才争夺中的重要收获。行业AnthropicKarpathyLLM10 个信源在谈事件专题推荐理由:Karpathy 的加入意味着 Anthropic 在 LLM 前沿研发上再添重量级人物,关注 AI 模型竞争格局的开发者值得关注后续动向。原文稍后读已读值得跟进有用关注 Anthropic
23:42Ate-a-Pi@svpino开发者Santiago Valdarrama分享了一种极简方法,只需引入一个库并添加一行代码,即可为基于LLM的应用开启完整的可观测性和自动分析功能。该方法能免费获取大量关键信息,如请求延迟、Token消耗、错误率等,极大简化了调试和性能监控流程。对于构建和部署LLM应用的团队来说,这是一个无需思考的实用技巧。技巧LLM可观测性监控推荐理由:做LLM应用开发的团队,监控调试一直是个痛点——现在一行代码就能拿到全链路数据,省去自己搭监控的麻烦,建议直接试。原文稍后读已读值得跟进有用关注 LLM
23:18TestingCatalog@testingcatalog88°AI 领域知名人物 Andrej Karpathy 宣布加入 Anthropic,重新投身研发工作。Karpathy 在 X 上表示,未来几年 LLM 前沿将尤为关键。他曾是 OpenAI 创始成员、特斯拉 AI 总监,并在 OpenAI 领导过研究。此举被视为 Anthropic 在 AI 前沿竞争中的重要人才引进,可能加速其模型研发。行业AnthropicAndrej Karpathy人才流动10 个信源在谈事件专题推荐理由:Karpathy 的加入意味着 Anthropic 在 LLM 前沿的研发实力大增,关注 AI 模型发展的读者值得留意后续动向。原文稍后读已读值得跟进有用关注 Anthropic
14:32官方账号arXiv cs.AI@Tinghan Ye, Arnaud Deza, Ved Mohan, El Mehdi Er Raqabi, Pascal Van Hentenryck精选本文提出一个基于LLM的智能体重优化框架,让非运筹学专家也能通过自然语言交互快速调整优化模型。该框架将LLM作为运筹学专家,将用户提示转化为结构化模型更新,并从优化工具箱中选择合适技术加速重优化。工具箱利用历史解、有效不等式、求解器配置和元启发式等原始信息,在保证解质量的同时提升计算效率。在两个大规模真实案例(在线供应链重优化和离线大学考试排程)中验证了其有效性和可扩展性。该框架减少了对运筹学专家的依赖,提升了决策支持系统的可持续性。论文LLM运筹优化重优化推荐理由:做供应链排程或排课系统的团队终于有了不用求OR专家的方案——LLM直接帮你改模型、选算法、出解,建议做运筹优化的开发者点开看实现细节。原文稍后读已读值得跟进有用关注 LLM
14:22官方账号arXiv cs.AI@Yuxiang Huang, Nuno M. T. Gonçalves, Federico Alvetreti, Lei Li, Xu Han, Edoardo M. Ponti, André F. T. Martins, Marcos V. Treviso精选72°DashAttention 提出了一种新的分层注意力机制,通过可微分的 α-entmax 变换替代传统 top-k 操作,自适应地为每个查询选择可变数量的关键值块,从而解决了现有方法(如 NSA 和 InfLLMv2)中固定块数和梯度阻断的问题。该方法保持整个层次结构完全可微分,且具有非分散性,提升了长上下文建模能力。实验表明,在 75% 稀疏度下,DashAttention 的准确率与全注意力相当,在高稀疏场景下优于 NSA 和 InfLLMv2。其基于 Triton 的 GPU 实现推理速度甚至超过 FlashAttention-3。DashAttention 为长上下文模型提供了一种高效且经济的方案。论文注意力机制长上下文稀疏注意力推荐理由:长上下文 LLM 的推理成本一直是痛点,DashAttention 用可微分稀疏注意力在保持精度的同时大幅提速,做长文本推理和模型优化的研究者值得关注。原文稍后读已读值得跟进有用关注 注意力机制
10:49官方账号Simon Willison’s Weblog(博客/媒体)精选Simon Willison 在 PyCon US 2026 上用五分钟闪电演讲总结了 LLM 领域过去六个月的发展。他重点介绍了 2025 年 11 月的“拐点”,当时最佳模型在三大提供商间易手五次,最终 Claude Opus 4.5 胜出。更关键的是,编码代理从“偶尔可用”跨越到“日常可用”,显著减少了人工修复错误的时间。他还分享了个人项目 micro-javascript,一个用 Python 实现的 JavaScript 解释器,展示了多语言嵌套运行的技术趣味。演讲通过“鹈鹕骑自行车”SVG 测试直观对比模型能力,强调编码代理的进步是最大亮点。行业LLM编码代理模型对比推荐理由:Simon 用五分钟讲清了 LLM 过去半年的关键转折——编码代理从玩具变成生产力工具,做 AI 开发或重度使用编程助手的团队值得花五分钟了解这个趋势,看完会对模型选择和工具策略有更清晰的判断。原文稍后读已读值得跟进有用关注 LLM
10:25官方一手arXiv: Anthropic@Nikola Milosevic精选本文提出一种双过程记忆架构,将即时情景记忆(固定10条消息窗口)与长期知识(约3 tokens/消息增长)解耦,解决LLM在科学协作中的上下文窗口饱和问题。在15,000条消息、跨6个模型(OpenAI、Anthropic、Google)的1,440次查询评估中,该架构在10,000条消息时仍保持70-85%准确率,延迟1-2秒,且比全上下文模型节省62% tokens。研究发现双过程架构在数值/时间查询上表现优异(65-90%准确率),而RAG在历史检索上更优(60-85%),并揭示了合成测试与现实工作流之间的“模拟到现实”差距。该架构成功管理了14,000+科学事实(125k tokens),证明领域特定记忆整合可支持超长上下文持续运行。论文记忆架构科学智能体上下文窗口10 个信源在谈事件专题推荐理由:做科学计算或长期实验分析的AI开发者,终于有了对抗上下文饱和的实用方案——双过程架构直接省62% tokens还保持高精度,值得在长链推理任务中试试。原文稍后读已读值得跟进有用关注 记忆架构
10:12官方账号arXiv cs.AI@Zhaoyue Sun, Hainiu Xu, Andero Uusberg, James J. Gross, Petr Slovak, Yulan He精选现有LLM情绪理解评估依赖离散标签预测,忽略了情绪产生的认知过程。研究者基于评价理论提出CAREBench,首个包含完整推理链注释的基准,涵盖评价推理、评价评分和多标签情绪标注,从第一和第三人称视角分析真实叙事。实验发现,强模型在某些任务上达到或超越人类,但在评价推理和积极情绪识别上仍有不足;模型在推理链步骤和评价干预敏感性上表现出分离现象,且未内化人类主观异质性的机制。这表明下游情绪预测指标可能高估了LLM的真实情绪理解能力,CAREBench为更诊断性的情感认知评估提供了基础。论文LLM情绪理解评价理论推荐理由:做AI情感计算或人机交互的团队,这个基准能帮你发现模型在情绪理解上的真实短板——别被下游指标骗了,建议点开看看评价推理链的设计。原文稍后读已读值得跟进有用关注 LLM
10:01官方账号arXiv cs.AI@Ferhat Erata, Hao Zhou, Luke Huan精选研究人员提出了一种名为 fidelity probes 的方法,通过从代码中生成带真实答案的自然语言问题,来评估候选规格说明与代码的一致性。该方法将一致性分数分解为矛盾率和覆盖缺口率,从而指导规格说明的迭代改进。在包含约 12,000 行 COBOL 代码的基准测试中,经过八次迭代,规格说明的一致性从 0.63 提升至 0.94,且收敛点可通过两态马尔可夫固定点预测。探针可由 LLM 或静态分析管道生成,两者互补。该方法适用于任何应描述相同行为的成对工件。论文代码-规格对齐LLM静态分析推荐理由:做代码文档对齐或规格说明自动化的团队,可以拿这个方法直接改进现有流程——它用 LLM 和静态分析结合,能快速发现并修复规格与代码的不一致,迭代效率很高。原文稍后读已读值得跟进有用关注 代码-规格对齐