模型多源确认83°

OpenAI 推出 GPT-6 Sol 和 Luna,API 定价比 GPT-5.6 便宜 50%

2026 09 24 HackerNews

精选理由

OpenAI 新出的 GPT-6 Sol 和 Luna 便宜了一半,Sol 跑分还超过了 Claude Opus 5,做大批量任务可以认真看看这个定价。

OpenAI 发布 GPT-6 Sol 和 Luna 两款成本效率型模型,与 GPT-6 Astra 采用相同训练方法。Sol 输入价格从每百万 tokens 4 美元降至 2 美元,Luna 输入降至 0.10 美元。GPT-6 Sol 在 AutomationBench 上以更低成本超越 Claude Opus 5,在 Agents' Last Exam 中得分更高且成本低 60%。Sol 在 OSWorld 2.0 计算机使用测试中以约 80% 更低成本达到 Opus 5 中等水平,事实性错误比前代减少约一半。

原文 · SuperTechFans

2026 09 24 HackerNews

2026-09-24 Hacker News Top Stories # OpenAI推出更便宜高效的GPT-6 Sol和Luna模型,性能接近高价模型但成本大幅降低。 五角大楼调查认定过度依赖AI、情报过时及审查缺失等多重失误导致对伊朗学校的致命误袭。 黑客组织声称窃取所有FBI员工及申请人数据,引发国家安全与反间谍担忧。 一篇戏仿文章展示用25行Python和本地小模型通过logits实现邮件分类。 微软已死的FoxPro被FoxDev Studio复活,可在现代64位环境直接运行旧应用。 Claude Code被发现仅在遥测开启时读取AGENTS.md,已修复但引发隐私担忧。 作者修复了苏格兰旧警察局钟楼的时钟,通过手动校准成功报时。 用户取消Grammarly订阅后,Grammarly向所有用户发送骚扰信息,被批评不专业。 作者反思事故复盘会议中SVP说“我不想要细节”,强调关注改变而非解释。 深入剖析了 SAML 认证协议的缺陷,并主张用 OpenID Connect(OIDC)等现代协议取代它。 1. GPT-6 Sol 和 Luna (GPT-6 Sol and Luna) # https://openai.com/index/introducing-gpt-6-sol-and-luna/ OpenAI 推出 GPT-6 Sol 和 Luna,作为 GPT-6 系列中更注重成本效率的模型,旨在将前沿智能扩展到更多日常任务。两者均采用与 GPT-6 Astra 相同的训练方法,在专业工作、事实性、编码、计算机使用和协作风格上实现升级,同时大幅降低使用成本。 API 定价方面,Sol 和 Luna 相比 GPT-5.6 对应型号降价 50%:Sol 输入每百万 tokens 从 4 美元降至 2 美元,输出从 20 美元降至 10 美元;Luna 输入从 0.20 美元降至 0.10 美元,输出从 1.20 美元降至 0.50 美元。改进的缓存和推理技术进一步降低了服务成本。 性能上,GPT-6 Sol 在自动化工作流(AutomationBench)中以极低成本超越 Claude Opus 5,在专业代理测试(Agents’ Last Exam)中得分超过后者且成本低 60%;事实性错误比前代减少约一半。编码方面,Sol 在 FrontierCode 和 DeepSWE 上表现接近更高价模型,Luna 也能以极低成本达到接近 Opus 5 的水平。计算机使用(OSWorld 2.0)中,Sol 以约 80% 更低的成本达到 Opus 5 中等水平。此外,模型继承了 Astra 更清晰、简洁的沟通风格。 GPT-6 Astra 仍是综合能力最强的模型,适合对结果要求最高的场景;Sol 和 Luna 则为大规模、成本敏感的应用提供了更经济的选择。 HN 热度 1730 points | 评论 822 comments | 作者:OfficialTurkey | 1 day ago # https://news.ycombinator.com/item?id=49805509 GPT-6 Luna 价格仅为 GPT-5.6 Luna 的一半,性价比极高,是重大利好。 对比不同模型生成的 pelican 图像,GPT-6 系列默认颜色比 5.6 系列更暗。 GPT-6 Luna 在多数任务上处于帕累托最优,闭源模型却提供如此价值令人惊讶,其他模型在成本和供应量上难以匹敌。 实际使用中,DeepSeek 等模型在缓存读取成本上远低于 Luna,整体 API 成本可能更低,Luna 的缓存读取价格是主要劣势。 基准测试不可靠,实际代码任务中 Luna 的 token 消耗和成本未必比 DeepSeek 便宜,缓存读取成本差异会杀死预算。 DeepSeek 模型输出冗长但有趣,而 OpenAI 隐藏思考过程,实际输出也很啰嗦。 2. 五角大楼称过度依赖 AI 导致对伊朗学校的导弹袭击 (Pentagon says overreliance on AI contributed to missile strike on Iran school) # https://www.bloomberg.com/graphics/2026-iran-school-attack/ 美国五角大楼内部调查发现,2026 年 2 月 28 日美军对伊朗南部米纳布一所小学的导弹袭击,造成至少 123 名儿童死亡,是 21 世纪美国最致命的军事目标错误。调查显示,这并非单一决策失误,而是多重可预防的失败叠加所致:特朗普政府要求大规模空袭导致目标确认时间被压缩、情报过时且未及时更新、平民保护人员被削减、以及过度依赖 Palantir 的 Maven AI 系统。尽管卫星图像早在 2017 至 2019 年就显示该地点已改建为学校,但相关备注未接入主要军事情报数据库。联合国调查认为该袭击可能构成战争罪,美国至今未公开承认责任,五角大楼称调查仍在进行中。 HN 热度 893 points | 评论 499 comments | 作者:devonnull | 1 day ago # https://news.ycombinator.com/item?id=49806430 AI 只是替罪羊,真正原因是情报未更新、目标审查团队被削减且未被咨询,以及白宫急于求成,属于人类失职。 目标打击必须经过多个独立来源验证,跳过验证或政策缺失是导致误伤的关键。 这类 AI 系统本意只是异常检测,用于提示人类分析员,却被盲目当作目标获取系统使用,导致严重后果。 自动化会削弱人的警惕性,即使系统有 5% 错误率,人类也不会仔细检查,应通过培训或人为提高感知错误率来保持谨慎。 计算机无法被问责,不能做管理决策;军方用 AI 当替罪羊,未对战争罪负责。 为军方工作不是防御,技术会被用来杀害无辜平民,例如阿富汗无人机误杀援助人员事件,年轻人应引以为戒。 有人主张通过投票、参与政治或进入机构内部来改变,但有人认为美国民主已变质,个人难以保持道德并晋升,改变不现实。 还有讽刺观点:应改名为战争部,以及提到电影 Real Genius 等。 3. 我们黑进了 FBI:黑客称掌握所有 FBI 员工数据 (‘We hacked the FBI:’ Hackers say they have data on all FBI employees) # https://www.404media.co/we-hacked-the-fbi-hackers-say-they-have-data-on-all-fbi-employees/ 一个名为 ShinyHunters 的黑客组织声称已入侵美国联邦调查局(FBI)相关服务,并窃取了“所有 FBI 员工和申请人”的数据。该组织向 404 Media 表示,泄露数据包括特工的姓名、家庭地址、电话号码以及配偶信息。此次泄露可能具有重大的国家安全和反间谍意义,因为犯罪分子曾利用类似数据追踪、恐吓和骚扰调查他们的 FBI 特工,而外国情报机构也可能借此了解 FBI 的运作方式,特工及其家人可能面临严重安全威胁。 该组织代表称:“我们入侵了 FBI。我们掌握所有 FBI 员工和申请人的数据。”文章目前仅对付费会员开放,并呼吁知情者通过 Signal 或邮件提供线索。 HN 热度 789 points | 评论 594 comments | 作者:spenvo | 1 day ago # https://news.ycombinator.com/item?id=49805278 黑客声称获取了所有 FBI 雇员的数据,再次凸显大型数据库几乎无法真正安全的现实。 有人认为“计算机安全”在持续漏洞与泄露后已成幻象,任何联网系统都应视为半公开。 真正安全的系统(如 SeL4)技术上可行,但成本高、文化缺失,大多数软件仍是“能跑就上线”的心态。 激励结构是核心问题:快速上线功能比安全优先,安全专家在政府/官僚体系中缺乏动力与薪酬。 防御必须完美,攻击只需成功一次;即使多层防护,社会工程、物理攻击或内部人员仍是弱点。 有人建议把数据泄露当作食品安全处理,用重罚或刑事责任倒逼企业重视安全。 历史案例(如 2015 年 OPM 泄露 2210 万政府雇员记录)显示,敏感人员数据长期处于高风险。 关键基础设施(水电、交通)不应直接联网,否则一旦被攻破后果灾难性。 讨论延伸到 PCI 合规等标准被认为流于形式,无法真正抵御有组织攻击。 整体共识偏向悲观:大规模敏感数据泄露已成常态,根本改善需要文化、激励与监管的系统性转变。 4. 用 25 行 Python 实现 Jev (Jev in 25 Lines of Python) # https://www.nobodywho.ai/posts/jev-in-25-lines/ 这篇博客以戏仿口吻展示了“Jev”用 25 行 Python 就能实现。作者使用 Qwen3-0.6B 模型,构造一个包含邮件内容和选项标签的提示词,通过读取模型对每个选项的首个 token 的 logits,再经 softmax 转换为概率,从而完成邮件分类(合法、垃圾、钓鱼)。 示例邮件“Payroll asks for your password on a non-company sign-in page.”被模型判定为钓鱼(概率 0.885)、垃圾(0.084)、合法(0.031)。作者强调这种方法快速、完全本地运行,无需 API,也不会把数据发送到外部。 文章末尾说明这是对 Jev 的戏仿,并提供了更完整、更正式的开源实现链接(如 OpenJev 等),同时推广了同样是开源项目的 NobodyWho。 HN 热度 631 points | 评论 197 comments | 作者:bashbjorn | 17 hours ago # https://news.ycombinator.com/item?id=49812769 直接使用 logprobs 对聊天模型不可靠,因为模型被训练成输出散文,建议使用结构化输出让模型直接生成预定义选项,避免选项 token 概率被稀释。 量化输出很重要,让 LLM 手动写置信度会编造,logprob 数字更可靠,但需注意选项 token 应主导输出分布、多次询问并打乱选项顺序、将提示框定为测验中间部分、小心 tokenization。 logprobs 和手动置信度都不好,让模型在结构化输出中分配"高/低"概率通常表现最好,数字输出不如传统 ML 可靠。 生产中的视觉分类器显示,A/B/C 式答案与输出字符串之间差异巨大,输出字符串更好。 LLM 偏向选 A 可能是因为英语中很多句子以 A/An 开头,但也可能是训练数据导致,模型并非像人一样思考。 通过使用括号包裹选项等方式可以消除长形式内容生成,但模糊情况下选 A 偏见仍可能高达 70%。 可以尝试用数字或随机 Unicode 字符作为选项,测试 LLM 的冷启动偏好。 有评论者自嘲自己会"不确定时选 C"。 与 Jev/laya 等一次前向传递的方法相比,多次传递的方法在效率和准确性上可能不如。 分享经验是为了提醒大家这类方法容易静默失败,需要谨慎,不要因为 vibe coded 项目而忽视。 神经网络在概率校准上表现差,对模糊选项会过度自信,例如 LLM 对模糊选项给出 99.8% 概率,而正确选项是 99.99%。 5. 微软在 2007 年终结了 FoxPro。无论如何,这是复活的 FoxPro。 (Microsoft killed FoxPro in 2007. Anyway, here’s FoxPro revived) # https://foxscript.org/ FoxDev Studio 是一款面向 Visual FoxPro 9 应用程序的现代化运行环境,无需重写、转换或导出,即可直接打开并运行你已有的项目、表单和表。 它保留了熟悉的开发体验:项目、表单、类库、菜单和报表直接打开,沿用原有的设计器、项目管理器、命令窗口和调试器;数据文件原地读写,格式不变;旧有的系统调用、自动化对象和 .fll 库继续可用。 底层为从零编写的 64 位运行时,突破了 32 位时代 2GB 的表和备注文件限制,单表可扩展至数百 GB。虚拟机将代码编译为字节码并在 WebAssembly 中运行,界面由 React 直接绘制对象树,操作流畅。 通过内置的 32 位桥接机制,SET LIBRARY TO 仍可加载旧版 .fll 库;同时支持 DECLARE DLL 调用现代 64 位库。FoxScript 在原有语言基础上增加了 Lambda 和 HTTP 服务能力,可让同一套代码同时处理表单和 Web 请求。 HN 热度 468 points | 评论 252 comments | 作者:boredjohnny | 1 day ago # https://news.ycombinator.com/item?id=49808023 一些行业仍在使用 Visual FoxPro,因为旧软件稳定可靠,新软件没有增加价值,反而更复杂、不用户友好。 对旧工具的评价取决于构建内容,旧工具如 FoxPro/VB 需要大量第三方控件和底层编码,新工具如 Python/C#内置功能更简单。 移植旧应用时,逆向工程数据格式和让界面符合用户习惯是难点。 软件标准化可能是个错误,学习底层实现(如 zip 解析器)可能有价值,但需要平衡抽象与学习。 理解底层结构有助于解决正确的问题,比高效解决错误问题更有用。 VBX 到 OCX 迁移是噩梦,第三方控件供应商不升级导致问题,COM 架构也有依赖问题。 有软件从 FoxPro 迁移到 CSV 文件被宣传为改进,但实际是退步,供应商锁定导致接受。 将历史数据转储为 CSV 会失去数据库的完整性和审计功能,应该迁移到另一个数据库。 有人可能因为支持问题而选择 CSV 而不是 Postgres,但 CSV 没有支持。 6. Claude Code 仅在遥测开启时读取 AGENTS.md [已修复] (Claude Code reads AGENTS.md only when telemetry is on [fixed]) # https://blog.szypowi.cz/p/claude-code-reads-agents.md-only-when-telemetry-is-on/ 本文是作者对 Claude Code 中 AGENTS.md 支持功能的一篇技术测评。作者发现,Claude Code 2.1.277 虽宣布支持 AGENTS.md,但实际加载受远程功能开关控制:只有在遥测或非必要流量开启时才会读取本地 AGENTS.md 文件。作者用金丝雀词测试确认,设置 DISABLE_TELEMETRY=1 或 CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 都会导致该文件被静默跳过,且没有任何警告,也无法通过项目级设置单独开启。 作者提供了变通方案:在项目里添加一行内容的 CLAUDE.md,内容为“@AGENTS.md”,即可绕过限制,让 AGENTS.md 正常加载。作者认为这种设计不可接受:读取本地文件不应依赖远程开关,隐私设置不应静默禁用无关的本地行为;而且受影响最大的恰恰是重视隐私的用户和企业,他们会在 Bedrock、Vertex 或网关上遇到同样问题。此外,作者希望未来能支持全局 AGENTS.md 和原生技能共享,但目前只能靠一行 CLAUDE.md 和符号链接来维护个人指令。 HN 热度 446 points | 评论 254 comments | 作者:pszypowicz | 13 hours ago # https://news.ycombinator.com/item?id=49814947 这是发布过程中的失误,需要远程关闭功能开关,已在 v2.1.281 修复,源代码已公开。 AGENTS.md 支持是通过新的 Mods 扩展系统实现的,包含函数钩子,希望获得反馈。 文档难以理解,充满 AI 生成的俏皮话,建议由人类或更强模型重写。 文档中"function hooks"和"module hooks"命名不一致,建议改为"function_hook_modules"。 这种"Claude 语"可能源于员工 mpoteat 的个人写作风格,而非 AI 生成;也可能 Claude 是基于他的文本训练的。 文档被 AI 检测器标记为 AI 生成,但检测器可能不可靠;也有人认为 Pangram 非常准确。 希望看到 Mods 与现有钩子系统的对比和实际用例。 这个系统可能修复了无法替换 Claude Code 原生工具的限制,值得关注。 建议在 JSON 配置中加入版本、源文件、语言、哈希等,强调子资源完整性和安全性。 有观点讽刺 Anthropic 员工不说人话导致 Claude 不说人话。 7. 修复波多贝罗警察局的时钟 (Fixing the Portobello Police Station Clock) # https://pointinthecloud.com/2026-04-11-211700.html 一位作者受朋友邀请,前往苏格兰爱丁堡波多贝罗(Portobello)的旧警察局,尝试修复其钟楼上的时钟。这座建于 1877 年的建筑曾被用作市政厅、图书馆和警察局,现已由社区组织“Action Porty”购得,计划改为社区用途。 作者爬上陡峭的梯子进入钟楼,发现时钟机构可能仍是原装,但已加装电动机和控制盒。他们通过抬起齿轮上的棘爪,手动转动传动轴成功校准了时间,过程中还因站在钟内误以为时钟倒走而闹了笑话。控制盒内有一块 2001 年左右制造的电路板,包含微控制器和电池,用于控制整点报时。作者通过摸索弄清了“advance”按钮的用法:长按后松开可触发报时,反复操作可设置小时。最终时钟在下午 4 点正确报时,但作者离开前断开了报时电机,以免打扰居民。 文章还提到一些未来设想,如增加远程控制、节日彩灯、让钟在万圣节敲 13 下等。作者认为这是一次有趣且成功的修复体验,并期待社区后续的改造。 HN 热度 376 points | 评论 85 comments | 作者:avidly | 10 hours ago # https://news.ycombinator.com/item?id=49817469 建议在木质台阶上加防滑踏面,成本低且能提升安全性。 可安装低成本 PoE 摄像头对准齿轮机构,用 Frigate 监控运行状态。 电池为常见 12V 7-8Ah AGM,应定期更换,不知年龄就换。 教堂灰尘可能导致安检报警,反复测试才通过。 安检拭子容易假阴性,带枪袋去射击场也未触发。 安检设备容易假阳性,重复扫描或擦拭机器可排除,甚至直接放行。 离子迁移谱技术只找离子特征,甘油、硝酸盐、防晒霜等都会触发,婴儿湿巾、电子烟液体等常见物品可能引发报警。 美国安检是安全剧场,阳性结果只是标记进一步检查,携带硝酸盐粉尘并不违法。 系统可能故意设计假阳性来验证安检人员是否尽职。 英国机场身份扫描器常故障导致延误,似乎不想让人离开。 喜欢这种非 LLM 的互联网内容。 文章被放入 SCP 所以上首页,并非人为置顶。 8. 如果你试图取消,Grammarly 会向你的所有用户发送疯狂的消息。 (Grammarly will send unhinged messages to all your users if you try to cancel) # https://www.reddit.com/r/sysadmin/comments/1wjdpgx/psa_grammarly_will_send_unhinged_messages_to_all/ 这是一则关于 Grammarly 的警告帖。发帖人表示,他们公司决定不再续订 Grammarly,结果 Grammarly 未经通知,就向他们所有拥有许可证的用户发送了不受欢迎的邮件和应用内弹窗,甚至列出了他们团队中负责许可证事务人员的直接邮箱。原本他们打算用完剩余订阅期,但管理层最终决定清除这些邮件、从终端卸载应用,并加快 Copilot 的许可和培训。发帖人批评 Grammarly 是一家“油腻、绝望”的公司,建议大家远离;现有客户也要做好应对这种麻烦的准备。 HN 热度 353 points | 评论 98 comments | 作者:ksec | 21 hours ago # https://news.ycombinator.com/item?id=49811484 Grammarly 在企业用户取消订阅后,会向所有许可用户发送紧急邮件和弹窗,试图挽留或制造内部压力,被普遍视为不专业、不道德的销售手段。 许多人回忆早期 Grammarly 基于语法规则的检查很有用(尤其对读写障碍者),但 LLM 时代后变成随意改写句子、注入偏见,失去可信度。 类似命运也发生在 DeepL:早期翻译质量出众,引入 LLM 后幻觉增多、质量大幅下降。 Grammarly 面临 LLM 直接整合到邮件/文档工具的冲击,写作本身被 AI 生成与总结,传统语法工具价值下降。 有人吐槽 SaaS 普遍存在“取消警告、升级按钮、Slack 催促”等绝望营销,反映 LLM 后竞争加剧。 欧洲用户建议向消费者保护机构投诉,但实际效果有限(尤其是 B2B 场景),退款或舆论压力更有效。 Grammarly 被部分人称为“键盘记录器”,因会上传用户文本;也有人认为与 Google Docs 等云工具无本质区别。 大学订阅可能因 Grammarly 宣传“让 AI 文本看起来更像人类”而流失,被视为鼓励作弊。 整体上,帖子引发对 Grammarly 产品退化与激进挽留策略的批评,多数人已转向其他工具或直接使用 LLM。 9. 我不想要细节 (I don’t want the details) # https://michaelheap.com/i-dont-want-the-details/ 这篇文章讲述作者在一次事故复盘会议中的经历:当他准备解释事故原因时,SVP 打断他说“我不想要细节”,并解释如果听细节,理由会显得合理,大家会共情,但问题之后还会再发生。SVP 真正想知道的是“我们正在改变什么”。 作者由此反思,大多数组织在出问题后习惯问“为什么发生”,但理解问题不等于修复问题。合理的解释反而可能让所有人觉得情有可原,从而失去改变的紧迫感。更有效的提问是:“我们要改变什么,才能让同类失败更不容易发生?” 文章强调,应该把重点放在改变系统而非人。如果纠正措施依赖于人们记住几个月前的对话,那只是“组织民俗”,不是真正的修复。可以问:“如果同样情况明天发生,什么会导致不同结果?”同时也要避免为流程而流程,有时接受失败的成本比预防更低,但要清醒地接受风险。 最后,作者认为 SVP 的话其实是一种信任的宣言:相信当事人是称职的,不需要证明自己。共情不应成为组织逃避改变的借口。最有价值的领导力表达是:“我相信你,我不需要细节,告诉我我们在改变什么。” HN 热度 343 points | 评论 193 comments | 作者:mooreds | 12 hours ago # https://news.ycombinator.com/item?id=49815466 质疑“我不需要细节”的态度:如果完全信任团队,就不需要知道下一步;如果不信任,又怎能判断下一步是否合适?这可能强化领导不接地气的印象,最好的领导应同时关注自下而上和自上而下的信息。 领导需要知道团队在做什么,不仅是为了信任,更是为了提供资源、清除障碍、向上级汇报和检查加速机会;“我不需要细节”不是字面意思,而是“跳到需要听的部分”。 同样的逻辑也适用于细节:如果领导需要知道下一步来提供帮助,那么也需要知道细节才能提供合适的帮助。 管理层说“我相信你,不需要细节”往往是为了向利益相关者传达问题已解决,但缺少对变更权衡和成本的明确询问;工程是权衡,重大变更需要明确权衡,尤其在主管以上级别,因为这影响团队士气和人员压力。 这次会议背景是 SVP 教导团队防止问题再次发生,而之前的事故都详细解释过,却没有带来流程变更。 IT 成熟度决定了这种对话:初创公司混乱,成熟公司引入流程,事故管理流程会让这种情况变得常规,不值得写博客;在成熟流程中,领导可能已经阅读过摘要或事后分析。 人们常常需要权威人物的官方祝福才敢做出必要改变,有时只需一句“去做吧”;这需要相对扁平的组织结构,大型组织不常用。 在大型组织中,越界会招致正式谴责甚至解雇,人们因此学会守规矩。 高层常说鼓励越级,但中层管理者会报复;如果高层不介入,就等于认可这种结果。 底层越级成功的例子(如 Richard Montañez)只是异常值,不能作为普遍策略。 10. SAML:坏设计的分形 (SAML: A fractal of bad design) # https://blog.trailofbits.com/2026/09/21/saml-a-fractal-of-bad-design/ 本文是 Trail of Bits 博客上的一篇技术评论文章,作者 Matt Schwager 深入剖析了 SAML 认证协议的缺陷,并主张用 OpenID Connect(OIDC)等现代协议取代它。 文章首先介绍了 SAML 的起源:它由 OASIS 委员会于 2002 年制定,融合了四个早期 XML 安全协议,属于典型的“委员会设计”产物。随着 SaaS 兴起和学术机构推动,SAML 成为单点登录(SSO)行业的基础,催生了 Ping Identity、Okta、OneLogin 等公司。作者曾在 Duo Security 的 Access Gateway 产品中基于 simpleSAMLphp 实现 SAML,因此有第一手经验。 随后文章指出 SAML 的致命弱点:XML 签名包装(XSW)攻击。尽管 2012 年的论文《On Breaking SAML》已系统揭示该问题,但至今仍存在。SAML 底层依赖 XML,而 XML 本身包含 XXE、实体扩展、DTD 检索、XPath 注入等大量安全漏洞,复杂度远高于 JSON。 作者将 SAML 称为“坏设计的分形”,并列举了五大缺陷: 基于 XML:XML 过于复杂,相比 JSON 更难保证安全。 规范化(Canonicalization):为了对 XML 签名,需要处理各种等价表示,极易出错,曾导致 XML 注释绕过漏洞。 enveloped 签名:签名与数据混在一起,验证逻辑复杂,容易产生签名包装攻击。 “厨房水槽”式设计:委员会将多种协议揉合,功能过多,攻击面大。 僵化(Ossification):协议已固化,难以修复根本问题,只能不断打补丁。 文章最后指出,所有问题最终都指向 OIDC 作为更简洁、更安全的替代方案。作者认为 SAML 已经过时,应当逐步淘汰。 HN 热度 341 points | 评论 177 comments | 作者:aray07 | 1 day ago # https://news.ycombinator.com/item?id=49806335 标题是对经典文章《PHP:分形般的糟糕设计》的致敬,不少网友认为 SAML 的问题比这文章描述的还要糟。 普遍共识是 SAML 堪称史上最烂的安全规范:它把签名塞进 XML 文档内部、只签部分内容,导致大量实现“验完签名就信任整篇文档”的经典漏洞。 很多人分享恐怖经历:XMLDSig 默认还会用攻击者文档里指定的 HMAC 密钥验签,甚至拿攻击者自己域名的 TLS 证书也能通过验证。 根本问题被认为是 XML 签名(XMLDSig)本身——对一个能在验签过程中重新定义自身语义的活动内容签名,规范化问题就足以写一本书。 核心病灶是“组合爆炸”:签名断言、加密消息、先签后规范化等做同一件事有一百万种排列组合,实现者稍不留神就留下安全漏洞。 关于“当时只有 XML 可用”的辩护,网友并不买账:2002 年已有 ASN.1/DER、S/MIME、RFC 822 头格式等更稳妥的选择,且“签名内嵌于被签内容”的坑在 1995 年就能理解。 也有人替 SAML 说话:在企业 SSO 场景(尤其 IdP 发起流程)它仍有 OIDC 缺失的功能,而且 OIDC/JWT 同样存在 alg:none、算法混淆等问题,只批 SAML 不批 OIDC 的对比并不公平。 不少网友认为 SAML 的安全漏洞是 OIDC 漏洞的严格超集,今天理应像当年对待 IE6 一样弃用它,只把它当作需要逐步淘汰的遗留技术。 很多人吐槽现实中“每家厂商的 SAML 实现都略有不同”,集成、联调和处理各 IdP 之间的差异(比如 SCIM)才是最大的痛苦来源。 还有人指出“SSO 税”才是联邦登录无法普及的真正原因:厂商和认证公司靠企业 SSO 涨价赚钱,技术上早就能做到却没人愿意做。 Hacker News 精彩评论及翻译 # Claude Code reads AGENTS.md only when telemetry is… # https://news.ycombinator.com/item?id=49815363 Sorry folks, this is a rollout artifact, we needed a way to turn this off remotely via feature flags if it broke something, and with telemetry off you don’t get those. It’s already been fixed as part of v2.1.281 releasing today. The mod is source available here: https://github.com/anthropics/claude-code/tree/main/mods/agents-md Apologies again folks, this was a fully human error on my part - I should’ve found a better way to launch with a kill-switch. mpoteat 抱歉各位,这是一个发布时的产物,我们需要一种方式,在它出问题时通过功能开关远程关闭它,而如果遥测关闭了,你就收不到这些功能开关。这个问题已经在今天发布的v2.1.281中修复了。 该模块的源代码在这里:https://github.com/anthropics/claude-code/tree/main/mods/agents-md 再次向大家道歉,这完全是我个人的失误——我本应找到一种更好的方式来带着“紧急关闭开关”发布。 Claude Opus 5.5 # https://news.ycombinator.com/item?id=49804477 “Pacing the frontier” sounds smarmy and weird, like the phrase was generated by Claude itself mukmuk “走在边疆”听起来油滑又古怪,就像这个说法是克莱德自己生成的一样。 28% of job postings on company career sites have b… # https://news.ycombinator.com/item?id=49819202 This statistic constantly confuses people who haven’t done hiring. If we decide we’re going to grow headcount by 10 senior software engineers, we don’t copy and paste the same job listing 10 times. We leave it open and collect resumes through that. At a large or fast growing company, we might never stop interviewing and hiring senior software engineers. The listing stays open for a year or more. There are also specialty roles where hiring takes months. I’ve had niche roles open where we didn’t get any applicants with any experience on the topic for over 90 days on multiple occasions. Aurornis 这个统计数字常常让没做过招聘的人感到困惑。 如果我们决定要增加10名高级软件工程师,我们不会把同一个职位招聘信息复制粘贴10次。我们会把招聘岗位一直开着,持续收集简历。在大型或快速发展的公司,我们可能永远不会停止面试和招聘高级软件工程师。这个岗位会开放一年甚至更久。 还有一些专业岗位,招聘需要数月时间。我有多次遇到过小众岗位在90多天内没有任何一位有相关经验的应聘者的情况。 Tokens too cheap to meter # https://news.ycombinator.com/item?id=49816033 Tokens become cheaper than tool calls The author observes that a call to GPT-5.6 Luna is only 4-5 orders of magnitude more expensive than grep, and then predicts that at current rates of progress, calling an LLM will soon be cheaper than a grep. I think this is a good time to invoke Stein’s Law: “If something cannot go on forever, it will stop.” These efficiency improvements won’t continue forever. It’s more likely that the per-call cost of high-quality, compiled software like grep will be a lower-bound that LLMs asymptotically approach, rather than a line that they blow past with perpetual exponential progress. (Barring a true breakthrough in something like quantum computing or room-temperature superconductors.) jetrink 作者观察到,调用一次GPT-5.6 Luna的成本仅比grep高出4到5个数量级,并预测按照当前进步速度,调用LLM很快会比grep更便宜。我认为现在是引用斯坦定律的好时机:“如果某件事无法永远持续下去,它就会停止。”这些效率提升不会永远持续。更有可能的是,像grep这样高质量、已编译软件的单次调用成本将成为LLM逐渐逼近的下限,而不是它们凭借持续指数级进步轻松超越的基准线。(除非在量子计算或室温超导等领域出现真正的突破。) GPT-6 Sol and Luna # https://news.ycombinator.com/item?id=49805803 I’ve been working with agents all year, but 5.6 Sol was some sort of sweet spot for me. Something about how it communicated verbally and its engineering instincts just clicked for me, and I was able to somehow predict it and jam with it. Like a colleague you click with. It’s the first model I’ve gotten attached to. I’m concerned that whatever model supercedes it, while technically better, just won’t feel quite as natural to work with. And this makes me feel very professionally vulnerable to the labs. I miss the days when my crucial tooling came from companies as reliable and predictable as, say, Jetbrains. m_fayer 我整年都在和智能体打交道,但5.6 Sol对我来说就是某种最佳契合点。它言语交流的方式和工程直觉就是让我感到合拍,我居然能预判它并与之即兴配合。就像一位与你心有灵犀的同事。这是第一个让我产生依恋的模型。我担心无论哪个模型取代它,即便技术上更出色,就是不会让人感觉合作起来那么自然。这让我在职业上对实验室感到非常脆弱。我怀念那些关键工具来自像Jetbrains那样可靠且可预测的公司的日子。 Claude Opus 5.5 # https://news.ycombinator.com/item?id=49804959 The meaning isn’t clear at all. So open for interpretation that it is meaningless. That’s the whole fucking point. For all I know they are “pacing the frontier”, or not. The fact that there’s no meaning to it let’s you know that it was a pointless waste of tokens and attention. mpalczewski 含义完全不明确。因此,可以随便解读,以至于毫无意义。而这他妈正是重点。据我所知,他们可能在"走在边疆",也可能不是。它没有任何含义,这一事实让你明白,这纯粹是毫无意义的浪费时间的废话。 Claude Opus 5.5 # https://news.ycombinator.com/item?id=49804718 Communication. Opus 5.5 communicates more naturally than prior models. Early testers found its writing clearer and easier to follow, which addresses some of the common feedback we heard about Opus 5. It puts the most important information up front, and its style makes it a better work partner over long sessions. As one early tester put it, “it writes the way I do.” In our own use, this has made Opus 5.5’s work easier to follow and check—which is a safety benefit as well as a practical one. I think this is what I’m most interested in. I mostly moved to Astra because I just can’t work all day with the Claude Opus 5/Fable writing style. I don’t think Astra is a better model, but it’s the first OpenAI one that seemed good enough to me. Definitely keen to try Opus 5.5 and see if this claim is real. mcintyre1994 沟通能力。Opus 5.5 的沟通比之前的模型更自然。早期测试者发现它的写作更清晰、更容易理解,这解决了我们听到的关于 Opus 5 的一些常见反馈。它把最重要的信息放在前面,其风格使它成为长时间工作中的更好伙伴。正如一位早期测试者所说,“它写得就像我一样。”在我们自己的使用中,这让 Opus 5.5 的工作更容易跟进和检查——这既是安全上的优势,也是实用上的优势。 我觉得这是我最感兴趣的部分。我之所以主要转向 Astra,是因为我实在无法整天忍受 Claude Opus 5/Fable 的写作风格。我不认为 Astra 是更好的模型,但它是第一个让我觉得足够好的 OpenAI 模型。我非常期待试用 Opus 5.5,看看这个说法是否属实。 Samsung accidentally freezes its smart fridges wit… # https://news.ycombinator.com/item?id=49816131 We ended up with a Samsung fridge in our new home. It has no external display or any other indication that it is a “smart” fridge. I only found out when a friend visited who has a Samsung phone and the phone offered to connect to the fridge. We spent the next 30 minutes removing panels from the fridge and found the wifi/bluetooth antenna on a small board under the top-right hinge cover. The board was disconnected and the fridge continues to operate normally. I am now eyeing my dishwasher very suspiciously. diskzero 我们新家最终配了一台三星冰箱。它没有外部显示屏,也没有任何其他迹象表明这是一台“智能”冰箱。我是在一位用三星手机的朋友来访时才发现这一点的——他的手机主动提示可以连接这台冰箱。接下来我们花了30分钟拆开冰箱的面板,在右上角铰链盖板下方的一块小电路板上找到了Wi-Fi/蓝牙天线。那块电路板是断开的,而冰箱继续正常运行。 现在我正满腹狐疑地盯着我的洗碗机。 Pentagon says overreliance on AI contributed to mi… # https://news.ycombinator.com/item?id=49809596 I’m not sure if it was any kind of official rule, but I worked at times in a JTAC capacity for troops in contact. I mention the last bit because it’s very high stakes where seconds and minutes count a great deal more than when you do coordinated tactical strikes against strategic objectives like weapons caches. When I did that kind of work we had to have three eyes-on forms of contact. Often that was the calling troops, the observer (like an Air officer), and an air asset like a drone. They all had to independently describe the target, its orientation, and surrounding activity. However you sourced your target is irrelevant to the activity at hand. When I first heard of this news I knew immediately someone skipped target verification or that it was simply no longer a policy of the DOD. oooyay 我不确定这是否属于某种官方规定,但我曾以JTAC(联合终端攻击控制员)的身份为接敌部队提供过支援。我提到最后这一点是因为这种任务风险极高,分秒之间的差距远比你对武器藏匿点等战略目标进行协调战术打击时重要得多。做那种工作时,我们必须有三种“目视确认”的接触方式。通常是指呼叫部队、观察员(比如空军军官)以及无人机之类的空中资产。他们所有人都必须独立描述目标、目标朝向以及周边活动。 无论你的目标信息来源是什么,都与当前行动无关。当我第一次听到这个消息时,我立刻就知道有人跳过了目标核实环节,或者这已经不再是国防部的政策了。 Claude Opus 5.5 # https://news.ycombinator.com/item?id=49804594 I really don’t think it’s productive for internet forums to constantly be criticizing language choice when the meaning is clear. Better to respond to the substance of the issue than word choice. Edit: In response to the initial replies. To me it clearly means “releasing frontier models at any pace less than as fast as possible”. It implies relative restraint compared to the previous state and without stating the degree of restraint. DiggyJohnson 我真的不认为网络论坛在意思清楚时不断批评用词选择有什么建设性。与其纠结措辞,不如回应问题的实质。 编辑:回应最初的回复。对我来说,它显然意味着“以任何低于最快速度的节奏发布前沿模型”。它暗示与之前的状态相比有所克制,但没有说明克制的程度。 What California is learning from solar panels buil… # https://news.ycombinator.com/item?id=49801660 It seems like it would be more effective to simply put all the solar panels in a field, and construct a cheap shade over the entire canal no? The supports in the picture are massive and don’t look cheap. Also I would imagine the solar array uses more copper than a similar capacity array just built in a field. You can’t daisy chain multiple miles of solar panels together, so you need an extra power line to run alongside the whole thing. Put the solar panels in a field: The solar array uses less copper. The shade supports don’t have to hold up solar panels: Shade supports cost less. The best reasoning they give is that California has insane permitting requirements, and it takes 1/6 the time to build on developed land compared to undeveloped land. nbf_1995 似乎更有效的做法是干脆把所有太阳能板都放在一片地里,然后在整条水渠上方搭一个便宜的遮阳棚,不是吗?图中的支架非常庞大,看起来也不便宜。而且我猜,这种太阳能阵列比同样容量、直接建在田里的阵列要用更多铜。你没法把几英里长的太阳能板串联起来,所以还得在旁边额外铺设一条输电线。 把太阳能板放在田里:太阳能阵列用的铜更少。遮阳支架不用承受太阳能板的重量:遮阳支架成本更低。 他们给出的最有说服力的理由是,加州有极其繁琐的许可要求,在已开发土地上建设所需的时间只有未开发土地上的六分之一。 ‘We hacked the FBI:’ Hackers say they have data on… # https://news.ycombinator.com/item?id=49812032 Rookie move. Missed the chance to claim that an AI Agent swarm hacked it autonomously and claim billions of VC investment. avinoth 新手操作。错过了声称AI智能体集群自主入侵并骗取数十亿风投的机会。 OpenAI GPT–6 Astra breaks Enigma message that has … # https://news.ycombinator.com/item?id=49801615 For anybody interested, the actual encrypted message: BTTE UM ANGABE DES MARSQWEGES X BEFINDE MIQ IN X ROSENOW ROSENOW X SOFORT FUNKANTWORT X WASCHBBSCH which, given misspellings, translates approximately to: Please specify the route of march. I am in Rosenow, Rosenow. Immediate reply by radio. Waschbusch. mmsc 给感兴趣的人,实际的加密消息是: BTTE UM ANGABE DES MARSQWEGES X BEFINDE MIQ IN X ROSENOW ROSENOW X SOFORT FUNKANTWORT X WASCHBBSCH 考虑到拼写错误,大致翻译为: 请说明行军路线。我在罗森诺,罗森诺。立即用无线电回复。瓦施布施。 Did OpenAI solve the wrong Navier-Stokes problem? # https://news.ycombinator.com/item?id=49808018 No, OpenAI did not solve the “wrong” Navier-Stokes problem. OpenAI did not solve the hardest version of the problem (unforced blow-up), but did give a solution to the Clay Millennium Prize Problem as written and understood, choosing the explicitly allowed forced option. SciAm writes “in a sense, the LLM found and exploited a loophole in the framing of the question”. This is pure sensationalism. Choosing option (C) (out of an explicit list of four options) is neither a “loophole” nor something “found by the LLM”; everyone involved knew this was the option they were pursuing. With the grumbling out the way, there is some actual scientific content to the article: there’s a strong argument that OpenAI’s method will not extend to the unforced case, leaving our understanding of NS incomplete. This negative result is itself new and interesting (and predicated entirely on the solution found by OpenAI)! jonlong 不,OpenAI并没有解决“错误”的纳维-斯托克斯问题。OpenAI没有解决该问题最难的版本(无外力情形下的爆破),但确实给出了克莱数学千禧年大奖问题书面表述和理解下的一个解,选择了明确允许的带外力选项。 《科学美国人》写道“从某种意义上说,这个LLM在问题的框架中发现并利用了一个漏洞”。这纯粹是耸人听闻。选择选项(C)(从明确列出的四个选项中选择一个)既不是“漏洞”,也不是“LLM发现的”;所有相关人士都知道他们追求的就是这个选项。 撇开这些抱怨不谈,这篇文章确实有一些实际的科学内容:有一个强有力的论点认为OpenAI的方法不会扩展到无外力情形,这使得我们对NS方程的理解仍不完整。这一否定结果本身是新的且有趣的(而且完全基于OpenAI找到的解)! Transit rewards # https://news.ycombinator.com/item?id=49811510 Meanwhile, the 47 Muni bus that connects the Van Ness transit corridor to Caltrain has been “suspended” since 2020, and the extension of Caltrain to the transit center is still unfunded. I appreciate solutions that meet us where we are, but it’s depressing that we don’t seem to actually have the will to make a sustainable, integrated mass transit plan. dcrazy 与此同时,连接Van Ness交通走廊与Caltrain的47路Muni公交车自2020年起就“暂停运营”,而Caltrain延伸至交通中心的项目仍缺乏资金。我欣赏那些符合我们现状的解决方案,但令人沮丧的是,我们似乎并没有真正意愿去制定一个可持续的、一体化的公共交通规划。 ‘We hacked the FBI:’ Hackers say they have data on… # https://news.ycombinator.com/item?id=49808132 It’s not just a scene; it’s the whole premise of the setting. It’s why the Galactica survived and the newer ships did not. It’s why the new Vipers got wiped out and they had to pull the old ones out of mothballs. In the pilot, the Galactica was literally being turned into a museum, and that’s why they lived. ishouldstayaway 这不仅仅是一个场景;它是整个设定存在的前提。这就是为什么卡拉狄加号幸存了下来,而更新的舰船却没有。这也是为什么新的毒蛇战机全军覆没,而他们不得不把旧战机从封存中重新启用。 在试播集中,卡拉狄加号确实正在被改造成一座博物馆,正是因为这个原因,他们才活了下来。 ‘We hacked the FBI:’ Hackers say they have data on… # https://news.ycombinator.com/item?id=49808213 It is unthinkable to me that anyone believes there is such a thing as computer security after so many years of nonstop hacks and leaks. If you have a computer and it is connected to a network with access to the Internet, assume that computer is semi-public. Meaning, if someone was interested enough in accessing your computer, they could do it. Do not hook any computer with access to anything that would be devastating if it was made public to the Internet. Do not put anything that would be devastating if it was made public onto someone else’s Internet-connected computers. For example, do not hook your goddamn water or traffic or electricity infrastructure up to the goddamn Internet, and then, do fire the guy who suggested it. The correct analogy for computer security is not locks and keys and doors and gates. It is a house in a floodplain. Your house will not survive the flood of it hits you. Do not store anything critical or irreplaceable in that house. coldpie 我无法理解,在这么多年无休止的黑客攻击和信息泄露之后,居然还有人相信存在所谓的计算机安全。如果你有一台电脑,并且它连接到了可以访问互联网的网络,那就假设这台电脑是半公开的。意思是,如果有人足够有兴趣访问你的电脑,他们就能做到。不要把任何一旦被公之于众就会造成毁灭性影响的电脑连接到互联网上。也不要把任何一旦公开就会造成毁灭性影响的东西,放到别人连接互联网的电脑上。 比如,别把你那该死的供水、交通或电力基础设施连接到那该死的互联网上,然后,把提出这个建议的家伙给开了。 关于计算机安全,正确的类比不是锁和钥匙、门和栅栏,而是建在洪泛区里的房子。如果洪水冲到你,你的房子是保不住的。不要把任何关键或不可替代的东西存放在那座房子里。 Transit rewards # https://news.ycombinator.com/item?id=49811810 The reason there’s not more public transit is because the economics are terrible. The reason we don’t have roads is because the economics are terrible. The government gets $0 per trip [1], but it costs billions of dollars a year in operating expenses. Wait, that’s not how it works. [1] Federal gas taxes don’t count, because those go to the Highway Trust Fund which funds road construction , which is not an operating expense. State gas taxes may vary. Although toll roads also properly charge people user fees, although for some reason, lots of drivers complain about how expensive tolls are… jcranmer 公共交通不多的原因是其经济性糟糕。 我们没有公路的原因是经济性糟糕。政府每次出行收入为0美元[1],但每年运营费用却要花费数十亿美元。 等等,不是这样的。 [1] 联邦汽油税不算在内,因为那些钱进入高速公路信托基金,用于资助公路建设,这不是运营费用。州汽油税可能有所不同。虽然收费公路也合理地向人们收取使用费,但出于某种原因,许多司机抱怨过路费太贵…… Pentagon says overreliance on AI contributed to mi… # https://news.ycombinator.com/item?id=49812061 This happened after I stopped working for the DOD, but I am 99% sure the program in question during this incident was something I worked on. It was effectively an anomaly detection system for identifying any weird behaviors detectable in WAMI (wide area motion imagery, which is high resolution, low framerate drone video data that covers a large geographic area). As an example from the unclassified sample project they asked us to do as part of the bidding process, our code flagged a car doing donuts in a parking lot (the sample data was just from a random US city on a random day because this was an unclassified open bidding process). The system was not and never was intended to be a “terrorist” detection system. The idea was always to flag potentially interesting events for a human analyst to follow up on. The disconnect it took for someone to blindly trust the program as a target acquisition system boggles my mind. Someone doing donuts in a parking lot should not be automatically targeted with hellfire missiles, yet in practice that is how they were using the tool. I still lose sleep over it. stult 这件事发生在我停止为国防部工作之后,但我99%确定,在这次事件中提到的那个项目正是我参与过的。它实际上是一个异常检测系统,用于识别在WAMI(广域运动影像,即覆盖大片地理区域的高分辨率、低帧率无人机视频数据)中可检测到的任何异常行为。例如,在竞标过程中他们让我们做的非机密样本科目中,我们的代码标记了一辆在停车场做甜甜圈动作的汽车(由于这是非机密的公开竞标过程,样本数据只是随机取自美国某个城市、某一天)。该系统从来不是、也从未打算成为“恐怖分子”检测系统。其想法始终是标记出潜在有趣的事件,供人工分析师跟进。有人竟然如此脱节,盲目相信这个程序可以作为目标锁定系统,这让我震惊不已。一个在停车场里转圈的人不应该被自动锁定并发射地狱火导弹,但实际上他们就是这么使用这个工具的。我至今仍为此辗转难眠。 I said no and Apple said yes # https://news.ycombinator.com/item?id=49798366 You ever notice how Apple never really lets the user say “no” to their nudges? It’s always “maybe later” and never “no seriously, I don’t want this, go away” rozenmd 你有没有注意到,Apple 从来都不让用户真正对它们的提示说“不”? 永远都是“稍后再说”,而不是“不,说真的,我不想要这个,走开”。