09:39官方一手arXiv: OpenAI@Maher Kallel, Mohamed El Louadi精选73°OpenAI模型在2026年5月提出了Erdős单位距离猜想的反例,同一日有五位数学家发布了人工验证版本。同年8月,该实验室发布了10个数学和理论计算机科学成果,每个都附带无未证明步骤的Lean 4机器可检查证书。四周后,其中一个结果仍存在关于其形式化是否意味着其所声称内容的未解决争议。研究指出,机器检查产生了验证丰富性,但裁决仍然稀缺。论文OpenAILean 4数学证明推荐理由:OpenAI模型提出数学猜想反例,机器检查证明与人工验证的冲突揭示了数学验证的新挑战。原文稍后读已读值得跟进有用关注 OpenAI
10:51Gary Marcus@GaryMarcus精选Christian Catalini发布新论文《AGI的简单经济学》,探讨了测量和验证如何塑造智能体经济。论文提出了完整的分析框架和操作手册,面向个人、公司、投资者和政策制定者。作者指出,没有验证的规模不是护城河,而是累积的债务。智能体时代的经济挑战在于确保监督基础的安全。论文AGI智能体验证推荐理由:Christian Catalini的新论文揭示了智能体经济的核心挑战,提供了实用的操作框架,对AI从业者很有价值。原文稍后读已读值得跟进有用关注 AGI
01:19elvis@omarsar0作者对GPT-5.6在编排与验证任务中的表现感到好奇。他通常使用不同的模型进行验证,并认为这种方式能带来更好的性能并减少奖励破解(reward hacking)导致的异常行为。目前尚缺乏适合这种测试时计算(test-time compute)范式的基准测试,作者通过多个实际项目来评估这些模式的效果。AI模型GPT-5.6OpenAI智能体10 个信源在谈事件专题推荐理由:一个开发者分享了他对GPT-5.6编排和验证的实践心得,用不同模型做验证能减少奖励破解,很实用。原文稍后读已读值得跟进有用关注 GPT-5.6
12:42官方账号arXiv cs.LG@Heloísa Dias Viotto, Cauê Samonek, Lucas Garcia Pedroso, Marcos Sunye, André Abed Grégio, Paulo Lisboa de Almeida本论文针对孪生验证网络(Siamese verification networks)中距离阈值的设定问题,提出了一种基于双峰分布假设的无监督方法。该方法通过识别距离分布两个模态之间的最低点来确定阈值,无需标注数据。在MNIST、CIFAR-10、LFW和PKLot四个数据集上的实验显示,平均验证准确率达到94%,与需要标注的等错误率(EER)方法性能相当。该工作使得验证阈值可直接在部署环境中更新,降低了人工标注成本。论文孪生网络验证无监督学习推荐理由:这篇论文教你怎么不用标数据就自动设好验证阈值,在四个数据集上测了准确率94%,跟用标数据的方法差不多,挺实用的。原文稍后读已读值得跟进有用关注 孪生网络
13:26Lenny Rachitsky@lennysanAnthropic工程师在2021年至2025年期间代码产出提升了8倍,编码被视为基本解决。产品团队当前最大的未解决问题是验证——如何确保构建的体验符合预期。这一观点来自Lenny Rachitsky与Anthropic旗下Claude Code/Cowork团队经理Fiona Fung的对话。Fung曾在Microsoft领导Visual Studio和TypeScript,在Meta参与VR/AR眼镜和Facebook Marketplace(年GMV超1000亿美元)。访谈还讨论了工程师的上下文切换、孤独感以及AI将影响哪些角色。行业AnthropicClaude Code编码效率10 个信源在谈事件专题推荐理由:Anthropic工程师写代码效率翻了8倍。但编码问题解决了,验证又成了新痛点。来听听Claude Code团队经理怎么说。原文稍后读已读值得跟进有用关注 Anthropic
19:11官方账号arXiv cs.AI@Linus Heck, Filip Macák, Roman Andriushchenko, Milan Češka, Sebastian Junges该论文提出将经典Shields模型扩展到概率安全场景的新框架。传统Shields确保绝对安全,但概率安全(允许以一定概率发生不良事件)更复杂。论文证明了强安全和最大允许性无法同时保证,提出了两种弱化保证的自然Shields,以及一种保持强安全保证的离线/在线构造方法。实验表明这些新Shields在计算可行性和实用性上具有优势,为自主智能体安全提供新工具。论文AI安全ShieldsMDP推荐理由:该研究为安全关键型AI系统(如自动驾驶、机器人)的概率安全验证提供了理论框架和实用工具,弥补了现有Shields方法在概率场景中的不足。原文稍后读已读值得跟进有用关注 AI安全