5月26日
06:36
06:36rohanpaul_ai@rohanpaul_ai
72°
Google 新论文指出,大语言模型的幻觉问题根源不在于回答错误,而在于错误时仍显得过于自信。论文提出应将目标从追求完美事实性转向让模型诚实表达自身不确定性,即“忠实的不确定性”。作者认为,模型缺乏的不是知识,而是对自身认知的元认知能力。对于智能体而言,不确定性感知能决定何时搜索、何时信任来源、何时停止,比工具本身更重要。

推荐理由:这篇论文点破了 LLM 幻觉的核心矛盾——不是知识不够,而是不知道什么时候该说“不确定”。做 AI 产品、智能体或对话系统的团队,看完会对“诚实比正确更重要”有更深理解,建议直接读原文。
5月25日
5月23日
07:06
07:06Browser Use@browser_use
Browser Use 团队发布了用 Rust 编写的终端 UI 和浏览器自动化工具 Browser Use Terminal。它直接通过 Chrome DevTools Protocol 控制浏览器,支持 GPT、Claude、Kimi、GLM、Qwen、DeepSeek 等多种 LLM。相比原 Browser Harness,速度提升 2 倍、成本降低一半,且完全开源。用户可以在终端中实时观察、暂停、恢复自动化任务,适合处理繁琐的网页操作。
事件专题

推荐理由:如果你经常在浏览器里做重复性操作(填表、爬数据、管理权限),这个 Rust 写的 TUI 工具比同类方案快 2 倍还便宜一半,而且支持多种主流 LLM,值得直接上手试试。
5月22日
5月21日
09:51
09:51Ethan Mollick@emollick
精选
根据公开的 LLM 资源使用估算,AI 解决一个 Erdos 数学问题仅消耗 0.6-6.3 kWh 电力和 3-31 升水。这相当于电动汽车行驶 2-20 英里的用电量,以及不到三颗杏仁的耗水量。该数据直观展示了 AI 推理的环境成本,引发对 AI 能效与可持续性的讨论。
推荐理由:这个数字对比让 AI 能耗变得可感知——做 AI 研究或关心可持续计算的读者,看完会重新思考模型效率的价值。
09:46
09:46官方账号arXiv cs.AI@Gundeep Singh, Parsa Kavehzadeh, Jing Xia, Xue-Yong Fu, Julien Bouvier Tremblay, Md Tahmid Rahman Laskar, Vincent Lum, Shashi Bhushan TN
精选
传统Text-to-SQL方法在企业环境中面临挑战,因为企业分析依赖受治理的API而非原始数据库。本文提出Analytic Agent,一个基于LLM的智能体系统,能将自然语言意图转化为安全的API交互。该系统通过多步推理和策略感知编排,实现用户目标理解、权限验证、受控查询执行和合规可视化生成。在90个真实企业用例上评估,表现可靠。
推荐理由:企业数据分析团队终于有了兼顾安全与易用性的方案——Analytic Agent解决了LLM直接操作数据库的合规风险,做BI或数据治理的开发者值得关注。
08:01
08:01
08:01官方账号Simon Willison’s Weblog博客/媒体
Mike Veerman 开发了一个 HTML 应用,模拟从 5 到 800 tokens/s 的 LLM 输出速度,帮助用户直观感受不同 token 速率下的文本生成效果。当看到模型宣传“30 tokens/s”时,可以用这个工具快速理解实际体验。该工具通过 Hacker News 传播,对评估和比较不同 LLM 的响应速度很有帮助。
推荐理由:选模型时经常被 token 速率数字搞晕?这个工具让你直接看到不同速度下的文本生成效果,做模型选型或写提示词优化的开发者值得一试。
08:00
07:59
07:59Ethan Mollick@emollick
72°
2024年6月,通用大模型连草莓里有多少个r都数不清;2025年7月,最新模型已在国际数学奥林匹克竞赛中获得金牌;到2026年5月,模型甚至解决了组合几何中一个著名难题。这一系列对比展示了LLM在数学推理能力上的飞速进步,从基础计数到顶尖竞赛再到前沿研究,仅用两年时间。

推荐理由:数学推理是AI能力的硬指标,从数不清草莓到IMO金牌再到解决几何难题,这个时间线让所有关注AI能力边界的开发者震撼——建议点开看看,你会对模型进化速度有全新认知。
5月20日
08:22
08:22官方账号Simon Willison’s Weblog博客/媒体
精选
llm-gemini 0.32a0 版本发布,与 llm>=0.32a0 alpha 兼容。新版本增加了流式传输推理令牌的能力,让用户能实时看到模型的思考过程。这对于需要理解模型推理逻辑的开发者来说是一个重要更新。该版本主要面向使用 Gemini 模型的 LLM 命令行工具用户。
推荐理由:流式推理令牌让开发者能实时观察模型思考过程,做 AI 调试或教学演示的团队可以直接升级体验。
00:20
00:20官方账号Andrej Karpathy@karpathy
83°
AI 领域知名人物 Andrej Karpathy 宣布加入 Anthropic,重返大语言模型前沿研发。他认为未来几年将是 LLM 发展的关键形成期,对此充满期待。Karpathy 同时表示仍对教育保持热情,计划未来继续从事相关工作。这一消息引发社区广泛关注,被视为 Anthropic 在 AI 人才争夺中的重要收获。
事件专题

推荐理由:Karpathy 的加入意味着 Anthropic 在 LLM 前沿研发上再添重量级人物,关注 AI 模型竞争格局的开发者值得关注后续动向。
5月19日