09:39官方一手arXiv: OpenAI@Maher Kallel, Mohamed El Louadi精选73°OpenAI模型在2026年5月提出了Erdős单位距离猜想的反例,同一日有五位数学家发布了人工验证版本。同年8月,该实验室发布了10个数学和理论计算机科学成果,每个都附带无未证明步骤的Lean 4机器可检查证书。四周后,其中一个结果仍存在关于其形式化是否意味着其所声称内容的未解决争议。研究指出,机器检查产生了验证丰富性,但裁决仍然稀缺。论文OpenAILean 4数学证明推荐理由:OpenAI模型提出数学猜想反例,机器检查证明与人工验证的冲突揭示了数学验证的新挑战。原文稍后读已读值得跟进有用关注 OpenAI
11:09官方账号arXiv cs.AI@Jason Hickey精选Generative AI enables economical and essential machine verification at scale, with one researcher directing a fleet of AI agents from code to silicon in five weeks using the Salt method. Verification is achieved through a proof kernel and Lean 4 kernel, with no human review required. The process involved theorem provenance, a token meter, and an error ledger with 256 catches, all against zero incorrect proofs.论文Salt methodgenerative AImachine verification推荐理由:Read this if you're interested in how generative AI is revolutionizing machine verification and the Salt method's impact on productivity. It's a fascinating look at the future of AI development without human intervention.原文稍后读已读值得跟进有用关注 Salt method
15:35官方账号arXiv cs.AI@Fanzhe Wei, Li Liu论文指出生产环境中运行时压缩的联合界预算在长请求上100%耗尽,提出任意有效且物理核算的账本,在352,333次准入调用中保持有效,并在预注册验证中将精确回退率从0.30降至0.14。通过机器校验的设计定律TV≤tanh(a_q w_thr)将服务TV目标转为阈值旋钮,三层审计定位了1064倍差距中的操作点。交换性外推在80个服务历史中提供有区分度的序统计界,校准风险0.41对比0.51。所有概率内核经Lean 4验证,导出228个定理无sorry。论文运行时压缩风险定价Lean 4推荐理由:这篇论文解决了压缩服务中风险定价的难题,用实际数据证明现有方法失效,并给出了可验证的新方案,对做推理优化的人很有参考价值。原文稍后读已读值得跟进有用关注 运行时压缩
23:13IT之家(博客/媒体)85°北京协和医院博士后金山木借助 OpenAI 的 GPT-5.6-Sol 模型,在约 16 小时内证明了自 2004 年悬而未决的 Crouzeix 猜想。康奈尔大学数学家 Alex Townsend、华盛顿大学 Anne Greenbaum 及猜想提出者 Michel Crouzeix 均已审阅并确认证明正确。此前人类专家在 2017 年仅将常数降至 2.414,而 AI 给出的证明依赖巧妙的采样策略。金山木已开源全部研究资料,包括论文、提示词和 Lean 4 形式化证明。该证明发布 8 天后,另有数学家发布了 5 页的独立证明。AI模型GPT-5.6-SolCrouzeix 猜想Lean 410 个信源在谈事件专题推荐理由:一个神经外科医生借 GPT-5.6 证明了 Crouzeix 猜想,数学家集体震惊。完整提示词和代码都开源了,可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song精选Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。论文VeroLean 4形式化验证推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。原文稍后读已读值得跟进有用关注 Vero
18:27官方账号arXiv cs.LG@Eric A. F. Reinhardt, Adam J. Hauser该论文提出软注意力机制在概率单纯形上的精确量子实现方案。注意力分数通过Hadamard测试统计获得,指数softmax与Born规则测量存在精确双射。温度参数对应重复测量次数,值聚合通过确定性列加载通道实现。所有可学习参数均为旋转门角度,组合层在无限射击极限下精确。代数核心已用Lean 4形式化验证。论文量子计算softmax注意力机制推荐理由:量子计算和注意力机制结合的新思路,把softmax映射到量子测量,数学上还挺严谨,搞量子ML的可以看看。原文稍后读已读值得跟进有用关注 量子计算
11:09官方一手arXiv: Google DeepMind@Ibrahim Mian, Shayaan SiddiqueErdős-Selfridge 奇数覆盖问题(Erdős #7)询问是否存在模数全为奇数、互异且大于 1 的覆盖系统。该论文在 Lean 4 中形式化证明了如下排除结果:任何由有限个同余类组成的奇数覆盖(模数互异且 >1)的最小公倍数必须超过 10000。证明结合了形式化的密度论证(覆盖的 lcm 必须是丰数或完全数)、核检查的丰数下界(无奇数 N<945 满足条件)、对 10000 以下全部 23 个奇数丰数的中国剩余容量证明,以及核检查的枚举。结果被移植到 google-deepmind/formal-conjectures 中的官方 StrictCoveringSystem ℤ 表述。全部 63 个已发布定理仅依赖 propext、Classical.choice 和 Quot.sound,无 any sorry 或 native_decide。论文Erdős-SelfridgeLean 4形式化验证推荐理由:DeepMind 用 Lean 4 把 Erdős-Selfridge 问题的一个下界(lcm>10000)变成了机器可检查的定理。对形式化数学和定理证明器感兴趣的话,这个工作很硬核。原文稍后读已读值得跟进有用关注 Erdős-Selfridge
09:03官方账号arXiv cs.LG@Junyu Ren精选EG-VAR提出基于Lean 4的形式化验证架构,通过工具调用公理和源声明确保每个输出都结构性地源自可验证的工具调用(定理3.1)和内核检查的有效推理链(定理3.2)。在TableBench数值推理子集(n=120)上,EG-VAR达到120/120,而相同工具基线为95%。在覆盖5个领域×2个模型的反事实压力测试中,EG-VAR保持100%源忠实度,相同工具下降至80-90%,无工具则为50-80%。LLM作为部署时形式化器时,Sonnet上的残余语义形式化错误率为3.3%,Opus为1.7%。论文EG-VARLean 4TableBench推荐理由:这论文搞了个叫EG-VAR的框架,用Lean内核做形式化验证,让LLM的推理结果100%可追溯,在TableBench上满分,比普通工具调用靠谱太多了。原文稍后读已读值得跟进有用关注 EG-VAR
10:46官方账号arXiv cs.AI@Chengkai Zhu, Ziao Tang, Guocheng Zhen, Yimeng Cao, Yusheng Zhao, Ranyiliu Chen, Xuanqiang Zhao, Lei Zhang, Xin Wang哈佛大学研究团队发布了Lean-QIT,一个基于Lean 4定理证明器的库,用于有限维量子信息论的形式化。它提供了量子态、信道、源编码和信道编码的可组合接口,并形式化了Schumacher量子源编码定理、Holevo-Schumacher-Westmoreland经典容量定理及纠缠辅助经典容量定理(含强逆)。该基础设施分离了操作定义与解析刻画,为AI辅助形式化和自动化证明搜索提供了可复用基础。论文Lean-QITLean 4量子源编码定理推荐理由:想用机器验证量子编码定理?Lean-QIT在Lean 4里搭好了整套框架,连HSW定理都形式化了,做量子信息形式化研究的朋友可以复用。原文稍后读已读值得跟进有用关注 Lean-QIT
16:00IT之家(博客/媒体)精选Mistral AI 于7月2日发布 Leanstral 1.5 模型,拥有119B参数(激活6B),采用Apache-2.0开源。该模型在miniF2F形式数学基准测试的验证集和测试集上均达100%完成率。在PutnamBench数学竞赛的672道Lean 4问题中可解决587道,FATE-H硕士级基准达成率87%,FATE-X博士级达成率34%,均为最佳表现。其平均解决成本仅4美元,远低于Seed-Prover 1.5的300美元以上和Aleph Prover的54~68美元。实际测试中在57个代码库标记47个违规属性,发现11个真实缺陷,含5个此前未报告的问题。AI模型Leanstral 1.5Mistral AILean 4推荐理由:Mistral AI 新出的 Leanstral 1.5,专攻数学证明,miniF2F满分,解决成本只要几美元,比竞品便宜几十倍,搞形式化验证的可以试试。原文稍后读已读值得跟进有用关注 Leanstral 1.5
15:29官方账号Decoder@Matthias Bastian精选Mistral AI 发布了 Leanstral 1.5,这是一个用于 Lean 4 形式化验证的开源模型。该模型在多个形式化数学基准测试中取得了领先成绩,例如在 miniF2F 测试中准确率达到 60%,超过此前的最佳模型。此外,Leanstral 1.5 在扫描 57 个开源代码仓库时,成功发现了 5 个此前未知的 bug。这些发现展示了该模型在数学证明和代码正确性验证方面的实用价值。AI模型MistralLeanstral 1.5Lean 4推荐理由:Mistral 新模型 Leanstral 1.5 专攻形式化验证,能自动找出代码漏洞,数学基准也比同类强。原文稍后读已读值得跟进有用关注 Mistral
06:24官方一手marktechpost@Asif RazzaqMistral AI发布Leanstral 1.5,一个Apache-2.0许可的Lean 4代码代理模型。该模型采用混合专家架构,总参数119B,每次推理仅激活6.5B参数。它在miniF2F基准上达到饱和,并在PutnamBench数学竞赛题中解决了587/672道问题。文章还介绍了其架构设计、基准测试结果和真实bug发现案例。AI模型Mistral AILeanstral 1.5Lean 4推荐理由:Mistral开源了Leanstral 1.5,一个能解数学竞赛题的Lean 4代码模型,Apache-2.0免费商用,实测解决587道Putnam难题,值得看看。原文稍后读已读值得跟进有用关注 Mistral AI
12:07官方账号arXiv cs.AI@Jui-Hui Chung, Ziyang Cai, Zihao Li, Qishuo Yin, Rohit Agarwal, Simon Park, Rodrigo Porto, Narutatsu Ri, Ziran Yang, Shange Tang, Xingyu Dang, Hongzhou Lin, Mengdi Wang, Danqi Chen, Chi Jin, Liam H Fowl, Sanjeev Arora精选83°Goedel-Architect 是一个基于 Lean 4 的智能体框架,通过生成和精炼“蓝图”(定义和引理的依赖图)来简化形式化定理证明。它先根据自然语言证明生成蓝图,然后并行证明每个引理节点,失败节点会驱动全局蓝图精炼,避免了传统递归分解的低效循环。使用开源模型 DeepSeek-V4-Flash 作为骨干,在 MiniF2F-test 上达到 99.2% pass@1,在 PutnamBench 上达到 75.6% pass@1。结合自然语言证明引导,可解决更难的题目,如 IMO 2025 的 4/6 和 Putnam 2025 的 11/12。该框架在开源管道中实现了最先进性能,且成本比同类开源方案低 500 倍。论文定理证明Lean 4蓝图生成1 个信源在谈事件专题推荐理由:形式化定理证明一直门槛高、成本高,Goedel-Architect 用蓝图+精炼策略大幅提升效率,做数学证明或形式化验证的团队值得关注,开源且成本极低。原文稍后读已读值得跟进有用关注 定理证明
09:41官方账号arXiv cs.AI@Quinn Dougherty, Max von Hippel, Hazel Shackleton, Mike DoddsFVSpec 是一个新基准,用于评估 AI 模型和智能体在真实软件形式验证任务上的能力。研究团队从真实 Python 仓库中抓取 11,039 个属性测试(PBT),并自动将其中 2,772 个(25%)翻译成 9,415 个 Lean 4 规范(含占位符)。翻译过程需模拟 Python 语义、推断逻辑属性并处理依赖类型编程的复杂性。团队设计了一个三智能体 LLM 流水线完成翻译,并提供了多种自动化与基于模型的证明生成基线。所有代码和数据已开源,旨在推动 AI 辅助真实软件形式验证这一未充分探索的领域。论文形式验证Lean 4属性测试推荐理由:形式验证是 AI 生成代码质量保障的关键,做 AI 安全或软件验证的开发者可以直接用这个基准测试自己的模型,看看能否补全 Lean 证明。原文稍后读已读值得跟进有用关注 形式验证
11:18官方账号arXiv cs.AI@Alessandro Sosso, Akhil Arora, Bas Spitters精选该论文评估了 Claude Code 在 CLEVER 基准(Lean 4 可验证代码生成)上的表现。结果显示,Claude 为 98.8% 的问题生成了有效的规范(其中 81.3% 通过了同构评分),87.5% 的问题通过了正确规范的实现验证,端到端管线成功率达 98.1%。Claude 还能对自身尝试提供高质量反馈,识别失败原因和数据集中的错误。这表明现有程序验证基准已不足以衡量现代智能体证明器的能力,需要更严格、抗错误的评估方法。论文程序验证Lean 4Claude Code推荐理由:程序验证是 AI 安全的关键环节,Claude Code 在 Lean 4 上接近完美的表现意味着做形式化验证的团队可以大幅提升效率,建议关注其编译器闭环范式。原文稍后读已读值得跟进有用关注 程序验证
15:41官方账号arXiv cs.AI@Gabriel Rongyang Lau精选本文报告了使用Aristotle API对IMO 2009第6题(Grasshopper问题)进行Lean 4形式化证明的案例。生成的代码包含一个广义定理的Lean版本、四个已验证的辅助引理,但主定理的证明中有一个未解决的“sorry”占位符。已验证的部分建立了局部数学性质,但全局组合计数步骤未被自动化证明覆盖。该案例揭示了AI辅助形式化的核心局限:局部证明搜索可以成功,但全局推理仍需人工介入。论文提供了可复现的Lean代码,并分析了已验证与未验证的证明内容。论文定理证明Lean 4Aristotle API推荐理由:这个案例对做AI辅助形式化验证的团队很有参考价值——它清晰展示了当前AI在局部引理证明上的能力,以及全局推理的瓶颈,做Lean或定理证明器开发的值得点开看看。原文稍后读已读值得跟进有用关注 定理证明
09:57官方账号arXiv cs.AI@Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen精选CAM-Bench是一个新的Lean 4定理证明基准,包含1000个计算与应用数学领域的证明目标,涵盖优化、数值线性代数和数值分析。这些题目改编自教科书习题,依赖局部定义、符号和算法。研究者开发了依赖恢复管道,将每个问题标准化为独立定理并翻译成Lean目标。该基准填补了现有形式化数学基准(如IMO风格问题)的空白,聚焦于应用数学中依赖教科书概念和初等定理的题目。评估显示,现有大模型和形式化代理在跟踪局部假设、应用初等结果、分解证明和长期控制方面存在常见失败模式。论文定理证明Lean 4基准测试推荐理由:做形式化验证或AI数学推理的团队终于有了应用数学方向的专用基准,比纯代数题更贴近实际工程场景,建议关注其失败模式分析来改进模型。原文稍后读已读值得跟进有用关注 定理证明
19:11官方一手arXiv: DeepSeek@Zeynel A. Uluşan, Burak S. Akbudak, Can S. Erer, Gözde Gül Şahin近期神经定理证明器使用基于可验证奖励的强化学习(RLVR),但面临稀疏奖励问题:困难问题中部分进展无法获得信号。为此,研究者提出学习奖励模型以评估证明质量,但比较不同奖励模型通常需要昂贵的RL训练消融实验。FormalRewardBench是首个专门评估Lean 4形式化定理证明中奖励模型的基准,包含250个偏好对,每个正确证明通过5种专家设计的错误注入策略生成错误变体。评估包括前沿LLM(如Claude Opus 4.5)、判别型LLM(如CompassJudger-1-14B)、通用LLM(如Qwen2.5-72B-Instruct)以及专用定理证明模型(如DeepSeek-Prover-V2-7B)。结果显示前沿LLM表现最佳(59.8%),而专用定理证明器表现最差(24.4%),表明定理证明能力并未迁移到证明评估任务。论文定理证明奖励模型Lean 4推荐理由:该基准填补了形式化定理证明中奖励模型评估工具的空白,揭示专用定理证明模型在评估任务上的不足,为改进RL训练信号提供了明确方向。原文稍后读已读值得跟进有用关注 定理证明