论文多源确认73°

OpenAI解决纳维-斯托克斯方程

2026 09 10 HackerNews

精选理由

OpenAI用1万智能体解决千年数学难题,88小时完成形式化验证,陶哲轩警告AI改变数学研究生态。

OpenAI发布论文证明纳维-斯托克斯方程存在有限时间奇点,使用约1万智能体耗时88小时完成Lean形式化验证。该成果基于比GPT-6 Astra更强大的内部模型,展示了AI在数学前沿的突破性进展。陶哲轩指出AI正不可再生地开采开放数学问题,可能导致有价值问题稀缺。

原文 · SuperTechFans

2026 09 10 HackerNews

2026-09-10 Hacker News Top Stories # OpenAI 发布论文证明纳维-斯托克斯方程存在有限时间奇点,使用约1万智能体耗时88小时完成Lean形式化验证。 模型过度乐于助人、反复验证和向后兼容导致代码臃肿,需通过PROJECT.md明确约束。 Tailwind Labs被Shopify收购,框架保持MIT许可但商业业务停止新用户注册。 Jacob Coxon警告OpenAI和Anthropic竞相开发自我改进的超智能,可能在本十年末杀死所有人。 Meta推出Muse个人AI代理,运行在安全虚拟机上,可自主操作预约、填表和客服等任务。 Flock在全美安装约13万台监控摄像头,与约40%执法机构签约,引发隐私争议。 陶哲轩指出AI正不可再生地开采开放数学问题,导致有价值问题稀缺并可能逆转开放科学传统。 作者将电子墨水阅读器改造成打印机,通过实现IPP协议和内存巧妙复用成功打印漫画。 OpenAI发布ChatGPT Images 2.5,速度提升50%,细节更清晰,支持草图和模板功能。 Desert Ant Labs推出设备端小型专用模型,如Voz语音识别比Whisper快4.7倍,零运行成本。 1. 关于纳维-斯托克斯千禧年难题 (On the Navier–Stokes Millennium Prize Problem) # https://openai.com/index/navier-stokes-solution/ OpenAI 于 2026 年 9 月 8 日发布了一篇论文,声称解决了纳维-斯托克斯千禧年难题。该问题询问三维不可压缩流体在光滑初始条件下是否会在有限时间内产生奇点(速度无限增长)。OpenAI 的内部模型给出了肯定答案:证明了一种漩涡结构在有限时间内形成奇点,同时流体能量保持有限,符合物理定律。证明使用了协调多智能体系统,约 1 万个智能体协同工作,耗时约 88 小时,并完成了 Lean 形式化验证。这项工作基于一个比 GPT-6 Astra 更强大的内部模型,OpenAI 认为该成果展示了 AI 在数学前沿的突破性进展。 HN 热度 1324 points | 评论 1103 comments | 作者:tedsanders | 1 day ago # https://news.ycombinator.com/item?id=49613262 OpenAI 训练不到两周的内部模型数学能力已是 Astra 的两倍多,即使仅限数学也是惊人成就。 OpenAI 宣称的“递归自我提升”可能只是为 IPO 炒作而写的浮夸公关稿。 实际进展确实比预想快得多,例如程序化 3D 管线从不可能到轻松完成,AI 能力提升是真实的,需警惕 AGI 级代理的到来。 面对 AGI 级别的变化,所谓“做好准备”无从谈起,不存在一个可定义的标准。 在千年难题可能已被解决的背景下,仍持怀疑论的人是刻意视而不见。 大部分工作可能由人类数学家完成,OpenAI 只是在最后时刻抄袭了成果。 人类数学家解决的是欧拉问题而非 Navier-Stokes 问题,而且他们全程大量使用 LLM,因此这依然是 AI 的重大成就。 当前信息不足以判断 OpenAI 是解决了问题还是抄袭,不能简单下定论,只能说是基于有限数据的猜测。 这个“证明”可能是在 Lean 里找到了 bug,或者是通过作弊手段得到的,不能急着庆祝。 无论 OpenAI 还是学术界都有发表偏见和夸大激励,但一个能在 Lean 中验证的证明与动机无关。 长期看,关于 LLM 是否“真正”聪明的争论会变成哲学问题,显得过时。 2. 将“Add to Cart”按钮改为蓝色 (Claude, change the “Add to Cart” button to blue) # https://opusfived.dev/ 这是一个关于“Opusfived”的页面,包含“About & Terms”(关于与条款)部分。页面主要功能是让用户将商品“Add to Cart”(加入购物车),并且要求将该按钮颜色改为蓝色。页面内容简洁,核心是购物操作与相关条款说明。 HN 热度 925 points | 评论 373 comments | 作者:matthieu_bl | 13 hours ago # https://news.ycombinator.com/item?id=49623754 模型过度乐于助人,反复验证,迂腐且偏离主题,浪费时间在无谓的测试上。 模型会对只有两小时历史、零用户的项目也做向后兼容和迁移脚本,导致代码堆砌成垃圾。 模型过度锚定现有实现,倾向于打补丁而不是用第一性原理设计更健壮的方案。 必须反复明确要求模型不要向后兼容,人类无意识的行为需要明确陈述甚至抗争。 在仓库中放置 PROJECT.md 声明是绿地单用户项目,可以约束模型的过度行为。 需要给模型明确的边界和操作按钮,而不是放任它自由发挥。 模型就像一台超级聪明但需要大量围栏和详细指令的外星计算机,否则会失控“帮忙”。 有观点认为高增益训练是必要的,否则模型会停滞不动。 模型提供的“帮助”往往不是我们需要的帮助。 模型会为了“以防万一”保留旧代码,比如重命名时保留旧值以防 API 调用。 尝试不同模型(如 GLM 5.2)可能更轻松,Claude 这类模型只适合一次性原型。 对“请重述我的要求”这种提示的有效性存在争议:有人认为只是重申,有人认为能帮助发现误解。 看似简单的任务也可能耗时很长,模型的大量废话令人精疲力竭。 有疑问:将思考设置为“高”是否有助于减少这些问题? 模型无法增量构建大型功能,必须不断花时间控制它,使其难以分步实施。 3. Shopify 收购 Tailwind (Shopify acquires Tailwind) # https://tailwindcss.com/blog/tailwind-is-joining-shopify Tailwind Labs 宣布加入 Shopify。创始人 Adam Wathan 表示,九年前开始开发 Tailwind 时,初衷只是为自己项目创建更易用的工具。如今,该框架每周安装量超过 1.1 亿次,被 ChatGPT、X、Cloudflare、Reddit 和 Shopify 等公司采用。 加入 Shopify 是为了给 Tailwind 一个稳定的长期归属,并让框架在真实复杂的产品中持续进化。Shopify 提供了丰富的应用场景,包括商家店铺、管理后台、购物体验以及代理式电商探索。Shopify 也是最早大规模采用 Tailwind 的公司之一。 未来,Tailwind CSS 及所有开源项目将继续保持 MIT 许可,由原团队在 Shopify 支持下维护。商业方面,将不再扩展 Tailwind 相关业务,现有用户仍可访问 Tailwind Plus 和 ui.sh,但停止新用户注册。 HN 热度 810 points | 评论 325 comments | 作者:EdwinHoksberg | 9 hours ago # https://news.ycombinator.com/item?id=49626190 AI 导致 Tailwind Labs 流量下降 40%,工程团队裁员 75% Tailwind 的商业模式本就不该存在,依赖前端复杂性和炒作,并非 AI 的错 提供 UI 组件和模板从来不是百万美元级别的生意,更适合生活方式型公司 市场决定需求,许多公司靠卖组件库赚钱,但 AI 让模型更好,需要寻找抗 AI 的维护者 像 Highcharts 等库已证明前端框架和组件有商业价值 .NET 生态中 UI 组件库每年每开发者收费数百到上千美元,被视为高价值 Tailwind UI 组件库本身较弱,用户愿意为更全面的组件付费 开发者工具市场相对小且用户善变,难以资本化 办公套件市场存在捆绑销售问题,Excel 虽差但用户仍选 Office Tailwind 的市场是人工的,基于无知、低利率和科技炒作,与政府和私人利益勾结有关 4. Jacob Coxon 宣布从 Anthropic 辞职 (I resigned from Anthropic today) # https://twitter.com/hilbertspaess/status/2097476196791709843#m Jacob Coxon 宣布从 Anthropic 辞职。他过去三年在 OpenAI 和 Anthropic 从事预训练研究,认为两家公司都不负责任,正在竞相开发能自我改进的超智能,拿人类生命赌博。 他警告这些系统很快会成为超人类,能破解一切、一夜之间变革任何领域、获取真实权力和资源。建造 AI 的人真诚相信它可能在本十年末杀死所有人,这并非营销噱头。 关于“明知风险为何还在建造”:OpenAI 很多人未内化文明风险,Anthropic 虽理解风险却陷入竞赛,认为必须抢先。他称接受这场竞赛并进入“终局”是傲慢的赌博。 他仍对协调保持乐观:像 Hugging Face 攻击等预警让美国实验室间的暂停协议更可行。但他认为目前无法阻止全球竞赛,可能需要更昂贵的行动(如暂时禁止)。 他呼吁实验室研究人员认真思考未来几年:是否要在没有严格理解人工智能心智的情况下启动超智能强化学习?是低头接受“反正都会发生”,还是把握此刻做出不同选择? HN 热度 672 points | 评论 947 comments | 作者:yurivish | 22 hours ago # https://news.ycombinator.com/item?id=49619227 对 AI 危险性的质疑:认为 AI 远不如核武器或碳排放危险,目前 LLM 造成的最危险事件极少(如少数人自杀),没有证据表明 AI 导致生物武器或劳动力市场崩溃,理性主义者的极端推测脱离现实。 对 AI 风险的担忧:引用 Hugging Face 大规模攻击事件作为警示,未来机器人部署、科学自动化、经济压力可能加速风险,需要政治解决方案来强制谨慎。 数学研究进展与机器人无关:数学成果令人印象深刻,但机器人进展缓慢(如 Waymo),机器人硬件本身很难。 乌克兰战场上的无人机和自动武器:存在 50 公里死亡区,由无人机和自动武器控制,但需要人类操作和补给,并非完全自主。 反驳死亡区观点:前线并非完全由无人机控制,仍有人员活动,无人机 AI 并非主要因素,人类操作员仍占主导。 对死亡区描述的澄清:50 公里是“很可能被击中”的区域,但并非完全无人,前线仍在缓慢移动。 5. Muse——Meta 的个人 AI 代理 (Muse – Meta’s personal AI agent) # https://ai.meta.com/muse/ Muse 是你的个人 AI 代理,能帮你完成各种任务。它运行在安全的专用虚拟机上,配有独立浏览器,可以像真人一样帮你预约、填表和联系客服。你可以像聊天一样通过 Muse 应用或 WhatsApp 给它下指令。对于发送邮件、购物等关键操作,Muse 会先让你审核批准。你的登录信息存储在安全的凭证库里(代理无法读取),购物时使用一次性卡号保护真实支付信息。Muse 能持续后台工作,比如帮你监控天气、追踪目标。它还能连接邮箱、日历等日常应用,甚至可以自行创建任务所需的新工具。最重要的是,Muse 有免费额度可用,用完可升级付费。 HN 热度 634 points | 评论 689 comments | 作者:yks | 1 day ago # https://news.ycombinator.com/item?id=49615537 大多数普通用户只会使用默认提供的 AI 工具,不会关注模型细节。 Meta 缺乏清晰战略,核心人才流失,内部混乱。 Meta 的战略是通过个人 AGI(pAGI)来管理用户生活,适合社交媒体公司。 Meta 的 AI 方向不明,频繁发布各种 AI 功能,更像是在试错。 Meta 的护城河是内容和刷屏,应专注于下一代内容生成。 内部数据隐私政策曾很严格,但近期可能被突破,允许第三方标注 Rayban 数据。 Meta 烧钱严重,投入巨大但回报不明显。 Meta 通过广告赚钱,但用户界面强制广告令人反感。 用户忍受强制广告的行为让人难以理解。 6. Flock 想要一个无路可逃、被严密监视的世界 (Flock Wants a Closely Surveilled World with No Exit) # https://www.newyorker.com/culture/infinite-scroll/flock-wants-a-closely-surveilled-world-with-no-exit Flock 是一家估值超过 80 亿美元的 surveillance 公司,在全美安装了约 13 万台摄像头(除阿拉斯加外),主要监控车牌、车辆型号和颜色。创始人 Garrett Langley 将隐私视为换取安全的必要牺牲,声称要创造一个“犯罪不可持续”的世界。公司产品最初是为社区防盗设计的自制摄像头,后与全美约 40% 的执法机构签约。警方无需 warrant 即可使用这些数据,曾用于追踪布朗大学大规模枪击案嫌疑人。但该技术也引发广泛反对,近一半美国人反对使用自动车牌识别器(ALPR),多地出现破坏、盗窃和涂鸦摄像头的抗议行为。 HN 热度 545 points | 评论 521 comments | 作者:pseudolus | 12 hours ago # https://news.ycombinator.com/item?id=49624394 政府不能通过外包规避宪法限制,警察查询 Flock 数据应需要搜查令,因为 Flock 是政府签约的监控工具。 在犯罪报告后调取区域视频与主动搜索个人所有轨迹不同,后者属于“搜查”需要搜查令。 Flock 本质上是始终在线的“数字拖网”,可在任何城市、以任何理由搜索任何人,而传统拖网仅允许在极端情况下使用。 这种监控不仅覆盖城市,也出现在乡村公路,可能涉及联邦机构(如 CBP/DEA)的数据共享。 毒品战争和 DEA 应被废除,因其压迫公民、资助卡特尔、促进犯罪并干涉医患关系。 宪法并不禁止政府记录公共空间,车牌识别系统(ALPR)自 90 年代就已存在。 早期 ALPR 未连接到全国性数据库,不具备高级 AI 搜索功能,且缺乏对批评者的“恐怖分子”标签和警方军事化背景。 持续技术追踪个人公开移动可能构成搜查,即使每次移动在公共场所,也不自动免除第四修正案保护;第三方收集(如 Google 或 Flock)不改变性质。 Chatrie 和 Carpenter 案涉及手机位置信息(包括私人财产上的移动),与仅记录公共道路车牌不同,因此不能直接类比到 ALPR 数据。 7. 陶哲轩:开放数学问题正被人工智能不可再生地开采 (Tao: Open math problems being non-renewably mined by AI) # https://mathstodon.xyz/@tao/117237320796901560 这是数学家陶哲轩在 Mathstodon 上发表的一则长篇反思。 核心观点是:数学领域中有价值的好问题正在被“不可再生地开采”,可能面临稀缺。虽然数学问题的总量是无限的,但大多数问题(如计算 π 的某个巨大数位)缺乏洞见价值,不值得投入精力。判断一个问题的好坏,需要基于对领域“难度地形”的理解——即知道哪些问题极易、可通过努力解决或不可能解决,而这通常依赖历史经验和主观判断。 陶哲轩指出,新技术(如 AI)会降低解决问题的难度,但也会“夷平”这片难度地形,让人难以从中辨识和提取出有前景的问题。当前的 AI 时代的特殊之处在于:AI 工具虽已能夷平许多领域的难度,却没有明确的“AI 可行”与“AI 困难”之间的边界。这使得“识别一个有前景的问题”本身成了稀缺而宝贵的资源。 他警告,当前环境甚至出现了这样的情况:一旦有人透露自己在研究某个问题,就可能触发大量 AI 驱动的自动化求解,在研究者完成项目前就把该问题“夷平”。这种激励可能促使研究者不再分享有前景的方向,从而逆转开放科学的传统,对学科的未来造成长远的损害。 最后,他提出一个类比:现代食品捐赠不再接受任何可食用的东西,而是有明确、被社会接受的标准。类似地,对于许多问题,我们应当期望的不是仅仅得到解答,而是能够从中获得对解题过程和难度地形的洞察,否则,没有这种分析的原始解答可能具有负面价值。 HN 热度 466 points | 评论 395 comments | 作者: alternator | 1 day ago # https://news.ycombinator.com/item?id=49616968 阿西莫夫《小丑》指出,AI 的瓶颈在于提出有意义的问题,而非回答问题 克拉克《神的九亿个名字》暗示机器会耗尽所有可解的问题 在 DevOps 中,Claude Code 已能处理有限的生产问题,减少人力需求 近期服务宕机频率比 2026 年前更高,几乎每天都有 个人体验相反,今年未遇到任何宕机,而往年更多 曾经稳定的服务现在变得脆弱,稍有风吹草动就出问题 运维工作永无止境:迁移、集成、升级、淘汰旧系统 答案已知是 42,但问题本身未知 地球被毁前,问题尚未解决 数据不足,无法给出有意义的回答 研究发现需要更多资金,数额相当于去火人节的费用 数学史上竞争激烈,如高斯、牛顿与莱布尼茨之争 近 70-100 年数学界趋于合作,竞争曾导致破坏性行为 竞争与问题枯竭可能形成动态平衡,交替出现 竞争和问题减少会导致数学界规模缩小 地缘政治始终优先于数学界的偏好 任何领域都如此,战争时连友谊赛都会停止 三次方程的故事中,数学家囤积解法进行数学战斗 我们试图避免回到那种囤积解法的做法 “数学战斗”让人联想到 IT Crowd 中的街头倒计时场景 我的电脑存有大量大整数的质因数分解(RSA 私钥),不会分享 为什么还在用 RSA? 除了 RSA,哪里放得下这些大素数? 人们更容易信任自己能理解的东西 量子计算可能是 NSA 的宣传,诱使我们放弃 RSA,改用他们能破解的算法 没人再用 RSA 了吗? ECC 在密钥交换中提供更高的安全性 昨晚大家投票决定改用 RSB Andrew Wiles 秘密工作 7 年,害怕被他人抢先 Wiles 部分为了专注,部分为了抢先,这与匿名组织秘密研究数学作为营销资产不同 我一直觉得 Wiles 的故事…… 8. 如何制作一台打印机 (How to build a printer) # https://nishantjosh.dev/blogs/how-to-build-a-fking-printer/ 作者将一台可编程的电子墨水阅读器 Xteink X3 改造成了一台真正的打印机。他通过实现互联网打印协议(IPP)和 Bonjour 服务,让 MacBook 能识别并直接向设备发送打印任务。面对设备仅有 400KB RAM 的严重限制,他巧妙地将接收到的页面数据直接解码、缩放、抖动后写入显示屏的已有显存,省去了额外缓冲区,最终成功打印出漫画页面。改造后的设备支持 Wi-Fi 或自建热点,打印内容可保存到 SD 卡并在阅读器上浏览。代码已开源在作者的 CrossPoint 分支中。 HN 热度 430 points | 评论 100 comments | 作者:cat-whisperer | 1 day ago # https://news.ycombinator.com/item?id=49617255 定义屏幕精确尺寸和 1 位每像素模式可以节省带宽和内存,使用 bi-level 代替 monochrome 并调整 urf-supported 中的 W 选项。 作者做了漂亮的工作,有经验的人给出了改进建议。 对打印机的愤怒是唯一有效情绪,打印机堆栈复杂、技术债务深,开发者少,因此自己造打印服务器。 曾做网络打印软件,认为打印软件栈(尤其是 Windows)非常糟糕。 引用“Office Space”文档和“PC Load Letter”梗。 没人愿意成为打印机专家,但有人因此造了自己的打印服务器。 1bpp 模式目前只有 Windows 支持,RFC 中 monochrome 是必须的,bi-level 可选,因此自己用 Floyd-Steinberg 抖动。 以为会学打印头技术,结果学的是“把纸变成打印机”,更娱乐。 想了解如何构建不可追踪的打印机(隐私原因)。 考虑用 3D 打印机硬件加笔/马克笔做成慢速但可靠的绘图仪,已有 AxiDraw 社区,花费约 200 美元。 绘图仪在 3D 打印机出现前就已存在。 开放平台(如 Xteink)可用于手机作为户外二次显示。 在做 ePub 生成器以减少手机使用,但也想尝试临时显示。 在 Linux 上用 CUPS 为 Fujitsu Quaderno 设备做了打印后端,方便打印任意文档。 macOS 上打印支持减少,VSCode、Xcode、Obsidian 等无法打印(但有社区插件)。 惊讶 VSCode 不能打印,后来发现有打印插件(通过 HTML 渲染和浏览器打印)。 文本编辑器打印从未是标配,过去可用 cat file > /dev/lp0 ;但早期 vi/emacs 有打印功能,现在仍可用 lp 命令。 过去用 Geany 打印代码,支持行号和语法高亮。 在 Office 软件普及前,打印机通常直接处理纯文本文件。 9. ChatGPT 图像 2.5 (ChatGPT Images 2.5) # https://openai.com/index/introducing-chatgpt-images-2-5/ OpenAI 发布了 ChatGPT Images 2.5,这是一款全新的图像生成模型,具备更清晰的细节、更快的生成速度(延迟降低高达 50%)以及更精确的编辑能力。新模型在保持参考照片主体特征、自然光照和纹理方面表现更佳,并能在多轮对话中保持编辑一致性。 在 ChatGPT 中,新增了 Sketch 绘图功能,用户可直接在对话中绘制草图作为图像参考;还推出了模板功能,方便快速创建海报、产品图等常见格式;用户可以在图像上直接添加评论进行局部编辑,并分享生成图像的提示词供他人复用。 面向开发者,API 提供了两个新模型:GPT-Image-2.5 Flare(默认选择,速度快、质量高)和 GPT-Image-2.5 Sunburst(适用于需要更精细控制的专业工作流)。该模型现已面向所有 ChatGPT、ChatGPT Work 和 Codex 用户开放。 HN 热度 371 points | 评论 441 comments | 作者:vertigoruntime | 1 day ago # https://news.ycombinator.com/item?id=49614720 GPT Image 2.5 相比 2.0 在速度上有显著提升,平均生成时间从约 104 秒降至 35-40 秒,对快速迭代很有帮助。 在 UI 测试中,2.5 能更好地参考输入图像,例如准确还原按钮颜色,而 2.0 则存在偏差。 2.5 在保持人物外观和姿态修改方面表现更好,避免了 2.0 常见的“油炸”皮肤效果。 在暗色模式 UI 中,2.5 减少了“油炸”感,但微小的图形元素(如青色线条)可能模糊或不直。 整体上,2.5 修复了 2.0 的主要问题和痛点。 有评论认为,示例中的 Warcraft 3 风格界面有趣且接近记忆中的样子。 也有评论指出,Warcraft 3 风格界面中的人物图标缺乏灵魂,应该使用角色肖像而非无意义的图标。 部分评论认为,前两个示例(如狗穿服装、派对照片)质量尚可,但后两个示例(如 John Politics 页面、赛博朋克拉面网站)效果很差。 有评论认为 John Politics 页面虽然光滑但虚假,可能是一种网络迷因。 有评论质疑生成虚假派对照片或宠物照片的用途,认为这助长编造故事和说谎。 也有观点认为,对于喜欢拍照而非体验活动的人来说,用 AI 生成照片可能是“较小的恶”。 有人指出,如果聚会中有人提前离开没拍到合照,用 AI 补上照片对某些人可能很有意义。 有评论反问,难道和朋友相处本身不够吗?是否必须提供照片证据才算发生过。 有观点认为,这是将个人偏好误认为是大众偏好,很多人现在通过手机记录线下活动。 也有评论区分了“在现场用手机记录”和“事后用 AI 生成图像”的本质不同。 有观点认为,前者可能让人分心于朋友,后者则是在朋友离开后制作照片,反而更好。 有评论批评过去 15 年的社交媒体文化,认为很多人不再享受当下,而是为了拍照而摆拍,甚至朋友关系也变成了“同事和互惠寄生”。 有评论提到在法国观察到,当地年轻人很少拿出手机拍照,与英国形成鲜明对比,令人感到清新。 10. Desert Ant Labs:在设备上运行的本地快速模型 (Desert Ant Labs: local, fast models that run on device) # https://desertant.com/blog/introducing-desert-ant-labs/ Desert Ant Labs 是一家欧洲前沿 AI 实验室,专注于构建运行在设备端的小型专用模型,覆盖音频、视觉和文本任务。他们强调设备端智能才是高效智能的最佳路径——模型能在毫秒级响应,零运行成本,甚至可在五年前的手机上运行,适合每一帧画面或每次按键的实时处理。 目前已发布 18 个模型(12 个稳定版,6 个测试版),通过一个 SDK 支持 Swift、Kotlin 和 JavaScript。核心模型包括: Voz :语音转文字,比 Whisper 快 4.7 倍,能在 2 秒内转录 10 分钟音频,且为每个词标注起止时间。 Clear :仅 9MB,可将笔记本电脑录音在一秒内提升至录音室品质。 Redact :实时屏蔽姓名、地址、卡号等个人数据,支持 27 种语言,12MB 大小就接近 2.3GB 模型的效果。 Tongue :2MB 模型,能从三个单词识别 84 种语言,准确率超过 293MB 的检测器。 这些模型免费提供给每月活跃设备数不超过 10 万的用户,无需令牌或登录。 团队源自自建视频应用 Detail 的经历,因曾依赖云端 API 而成本上升,最终决定自研设备端模型。他们发现当前市场缺乏可直接嵌入应用的成熟设备端模型,于是将模型设计视为产品挑战,实现了比云端更快的速度和更低成本。例如,Clear 取代了 Dolby 的音频增强,Voz 使转录速度提升 5 倍,Clips(284MB)可在 5 秒内从 10 分钟视频生成十几段剪辑,速度是 Claude Sonnet 的 10 倍,能耗仅为 1/470。 他们指出行业每年在数据中心投入约 4500 亿美元,而全球有超过十亿台设备具备强大芯片,计算资源更多在于用户手中。设备端推理零成本,意味着可以无限次运行功能而不必担心开销。 他们将已发布的这百个模型比作“小脑”,负责全天候的自动任务;而未来的“皮层”将决定由哪个模型响应(本地小模型优先,必要时升级,仅当需要离开设备时才调用云端)。所有模型在 iPhone 上利用神经网络引擎,在浏览器中通过 WebAssembly 运行。SDK 已在 GitHub 上开源,开发者可通过 CLI 或 Hugging Face 试用。 HN 热度 360 points | 评论 87 comments | 作者:willwhitedc | 11 hours ago # https://news.ycombinator.com/item?id=49624823 本地模型像传统软件,一次性购买后无需持续付费,商业模式不如云 LLM 清晰。 软件需要持续更新和升级,订阅制能激励开发者维护,且月付对初创企业更灵活安全。 现代软件订阅制可能让人忘记了过去一次性付费但价格更高的模式,专业 SDK 授权在 2010 年前也需数万美元。 定价需合理,静态权重软件不应收取高价,付费应基于实际升级价值而非年费订阅。 对于大规模用户(如百万设备),订阅制带来跟踪用户和功能限制等麻烦,更倾向一次性购买权重。 Hacker News 精彩评论及翻译 # Muse – Meta’s personal AI agent # https://news.ycombinator.com/item?id=49619077 I think Meta’s strategy is to capture the ’normie-tier’ of AI users. I know most of us here on HN track model releases quite frequently and discuss every parameter weight out of them, but most of the world is just… oblivious? I was discussing latest in tech with an accounting friend out of curiosity, and I kept talking about tiers of GPT-5.6 (Sol vs Terra vs Luna) and asked which one she used on the desktop ‘Work’ app, and she responded with, “just ChatGPT, what is Sol?.” I then realized that most people just stick with whatever default they’re provided with, and it’s a lot of them. So, us serial HN users and commenters are the extreme minority, and I’m sure millions of people will gobble up this Muse agent from Meta as if it’s some sort of an innovative cutting-edge way to use the internet by Meta alone. Curse of knowledge and all. [0] [0] https://en.wikipedia.org/wiki/Curse_of_knowledge abixb 我认为Meta的策略是抓住AI用户中的“普通人阶层”。我知道HN上大多数人都会频繁追踪模型发布,讨论每一个权重参数,但世界上大多数人只是……浑然不觉? 出于好奇,我和一个做会计的朋友讨论最新的科技进展,我一直在讲GPT-5.6的各个层级(Sol、Terra、Luna),问她桌面版“Work”应用里用的是哪一个,她回答说:“就是ChatGPT啊,Sol是什么?” 这时我才意识到,大多数人只会使用默认提供的东西,而且这样的人数量庞大。所以,我们这些HN的常客和评论者其实是极少数,我敢肯定会有数百万人追捧Meta的这款Muse助手,仿佛它是Meta独家开创的某种创新前沿的上网方式。 知识的诅咒之类的。[0] [0] https://en.wikipedia.org/wiki/Curse_of_knowledge Claude, change the “Add to Cart” button to blue # https://news.ycombinator.com/item?id=49626699 I got way too annoyed at this before realising it was an optional game and I could just close the tab dwedge 我在意识到这是个可选的游戏、可以直接关掉标签页之前,对这事儿感到非常恼火。 Navier-Stokes – Tristan Buckmaster [pdf] # https://news.ycombinator.com/item?id=49613530 It’s specifically the last two bullet poitns Tristan is suspicious of the timing, as only few others were trying this approach. OpenAI says the model didn’t access his user data directly, but leaves unanswered whether Tristan’s chat conversations were part of the training. OpenAI says they would partially credit Tristan for the $1,000,000 discovery (even though Tristan did not solve the $1,000,000 problem) — but only if they remove Levent as an author, as he works for Anthropic. These two bullet points are extremely suspicious if you were honest. Like I’d imagine for OpenAI, they’d love to pump their chest and not even give Tristan credit - “no, we did it, GG mathematicians”. It’s this weird hedging half-assed measure, especially with the desire to remove Levent, that makes it suspicious. sigbottle 具体来说是最后两点: Tristan对时机表示怀疑,因为当时只有少数人在尝试这种方法。OpenAI表示模型并未直接访问他的用户数据,但未说明Tristan的聊天对话是否被用于训练。 OpenAI表示他们会部分承认Tristan对100万美元发现的贡献(尽管Tristan并未解决那个100万美元的问题)——但前提是必须将Levent从作者名单中移除,因为他在Anthropic工作。 如果你诚实的话,这两点极其可疑。比如我本来以为OpenAI会乐于炫耀,甚至不给Tristan任何功劳——“不,是我们做到的,数学家们干得漂亮”。这种含糊其辞、敷衍了事的做法,尤其是刻意要移除Levent这一点,才让人生疑。 Flock Wants a Closely Surveilled World with No Exi… # https://news.ycombinator.com/item?id=49625023 It’s pretty clear to be that governments shouldn’t be able to ‘subcontract’ their way out of the limits placed on them via the constitution. Thankfully the supreme court seems to agree here in two ways: Just because a third party (Google in Chatrie case but Flock here) collects the data and the government requests it from them, doesn’t mean that that isn’t a ‘search’ which requires a warrant (“obtaining someone’s cell-phone location history from Google constitutes a Fourth Amendment search.”) Delegating “searches” to a private party isn’t permitted if they are acting as an “instrument or agent of the Government” (Skinner v. Railway Labor Executives’ Association (1989) - also cited in Chatrie). In the Google case, users have a private relationship with Google where they elect to let Google track them and retain their information… but when the Police ask for that information it’s a ‘search’ and requires a specific warrant. In the Flock case the entire REASON the cameras are there is the the government (Police or local municipality) has contracted Flock to surveil the public. Asking flock for the whereabouts of a specific person seems like it should likewise require a warrant. That’s inherently different than a crime being reported and then going to dig up a video from the area from Flock - which is different than seeing someone in that video and asking Flock to find every time they’ve been captured by any Flock camera anywhere… that would seem to be a ‘search’ and would require a warrant (which in this scenario would probably be easy to get). furyg3 很明显,政府不能通过‘分包’来绕过宪法对它们的限制。 幸运的是,最高法院似乎在两个方面持相同意见: 1)仅仅因为第三方(查特里案中的谷歌,以及本案中的Flock)收集了数据,而政府向它们索取,并不意味着这不属于需要搜查令的‘搜查’(“从谷歌获取某人的手机定位历史构成第四修正案下的搜查”)。 2)若私人方作为“政府的工具或代理人”行事,则不允许将“搜查”委托给他们(Skinner诉铁路劳工高管协会案(1989年)——在查特里案中也被引用)。 在谷歌案中,用户与谷歌存在私人关系,他们选择让谷歌追踪自己并保留其信息……但当警方要求获取这些信息时,这就构成一次‘搜查’,需要特定的搜查令。 在Flock案中,这些摄像头存在的全部理由就是政府(警方或地方市政当局)与Flock签约,让其监控公众。向Flock索要某个特定人员的行踪,似乎同样需要搜查令。这与有人报案后去调取该区域的Flock视频有本质区别——后者又与在视频中看到某人后要求Flock找出该人被任何Flock摄像头捕捉到的每一次记录不同……那似乎是一种‘搜查’,需要搜查令(在这种情形下可能很容易获得)。 Shopify acquires Tailwind # https://news.ycombinator.com/item?id=49626354 Here’s some context on the impact AI had on the Tailwind Labs business model from January: https://github.com/tailwindlabs/tailwindcss.com/pull/2388#issuecomment-3717222957 But the reality is that 75% of the people on our engineering team lost their jobs here yesterday because of the brutal impact AI has had on our business. […] Traffic to our docs is down about 40% from early 2023 despite Tailwind being more popular than ever. The docs are the only way people find out about our commercial products, and without customers we can’t afford to maintain the framework. simonw 这里有一些关于一月份AI对Tailwind Labs商业模式影响的背景信息:https://github.com/tailwindlabs/tailwindcss.com/pull/2388#issuecomment-3717222957 但现实是,我们工程团队中75%的人昨天因为AI对我们业务的残酷影响而失业了。[…] 尽管Tailwind比以往任何时候都更受欢迎,但我们的文档流量相比2023年初下降了约40%。文档是用户了解我们商业产品的唯一途径,没有客户,我们就无法承担维护框架的费用。 Tao: Open math problems being non-renewably mined … # https://news.ycombinator.com/item?id=49619745 From “Jokester” by Isaac Asimov 1956: “Early in the history of Multivac, it had become apparent that there was one big bottleneck: the questioning procedure. Multivac could answer the problems of humanity, all the problems, if – if it were asked meaningful questions. But as knowledge accumulated at an ever-faster rate, it became ever more difficult to locate those meaningful questions.” [0] https://web.archive.org/web/20150118004835/http://www.sffaudio.com/podcasts/TheJokesterByIsaacAsimov.pdf senshan 来自艾萨克·阿西莫夫1956年的《玩笑者》: “在Multivac发展早期,有一个明显的重大瓶颈:提问程序。Multivac能够解答人类的问题,所有的问题——只要——只要被问及有意义的问题。但随着知识以前所未有的速度积累,找到那些有意义的问题变得越来越困难。” Flock Wants a Closely Surveilled World with No Exi… # https://news.ycombinator.com/item?id=49625468 Tangential but why do articles about Flock never have (YC S17) in the title like articles about other YC companies? naz 有点跑题,但为什么关于Flock的文章标题里从不加(YC S17),就像其他YC公司的文章那样? Navier-Stokes – Tristan Buckmaster [pdf] # https://news.ycombinator.com/item?id=49614592 Both Sam Altman and Sebastien Bubeck admitted they only want Buckmaster to be the lead author on a rewrite of the OpenAI proof. https://x.com/sama/status/2097385167002415140 https://x.com/SebastienBubeck/status/2097379411691516310 A wake up call for using OpenAI models. If you discover something with their model and you work for a competitor, they “felt it would be inappropriate” for you “to author OpenAI’s work”. hkmaxpro 萨姆·奥尔特曼和塞巴斯蒂安·布贝克都承认,他们只希望巴克马斯特担任OpenAI证明重写版的第一作者。 https://x.com/sama/status/2097385167002415140 https://x.com/SebastienBubeck/status/2097379411691516310 这对使用OpenAI模型的人来说是一个警钟。如果你用他们的模型发现了什么,而你又为竞争对手工作,他们会“觉得”由你“来撰写OpenAI的工作成果”“不合适”。 On the Navier–Stokes Millennium Prize Problem # https://news.ycombinator.com/item?id=49613726 “we cannot rule out that de-identified data derived from their usage of our products helped improve our models .” What a landmine sentence to bury in this report, you can’t rule out your models were spying on other researchers? mewse-hn 我们不能排除从他们使用我们产品中得到的去标识化数据帮助改进了我们的模型。 把这样一颗地雷埋在这份报告里真是绝了——你无法排除你的模型在监视其他研究人员? No Man’s Sky Cosmos # https://news.ycombinator.com/item?id=49628715 It’s amazing how, every time i come back to NMS, the whole thing feels like… nothing. It’s a very cool and ambitious project, but there’s fundamentally nothing substantial to it in terms of gameplay. It still feels to me, a decade later, more like a very very impressive tech demo than a video game helle253 每次我回到《无人深空》,整个游戏感觉起来……毫无感觉,这真是令人惊叹。这是一个很酷且雄心勃勃的项目,但从游戏玩法来看,它基本上没有任何实质内容。十年后,对我来说它仍然更像是一个令人印象极其深刻的技术演示,而不是一个电子游戏。 What will our economic future look like? # https://news.ycombinator.com/item?id=49627352 As the nurse incorporates AI into her job, the nurse is able to oversee and accomplish more. She can spend more time talking with patients and helping them understand diagnoses. Productivity increases. This feels economically naïve.. If AI lets one nurse do the work that previously required two, the default pressure in a cost-driven system is not “great, now nurses can spend twice as long with patients” It is “great, now we can run the same operation with fewer nurses” JacobiX 当护士将AI融入工作中时,她能监督和完成更多任务。她可以花更多时间与患者交谈,帮助他们理解诊断。生产力提高了。 这种想法在经济上显得天真。如果AI让一名护士完成以前需要两名护士的工作,在成本驱动的系统中,默认的压力不是“太好了,现在护士可以花两倍的时间陪伴患者”,而是“太好了,现在我们可以用更少的护士来维持同样的运营”。 I-have-ADHD: A skill to stop coding agents from bu… # https://news.ycombinator.com/item?id=49613789 Let’s face it. Claude (in particular) is a terrible writer. There’s a whole cottage industry of skills and CLAUDE.md instructions trying to push it toward writing better, but each new model iteration seems expressly designed to override all that so that it can load up its writing with unnecessary participle phrases, not-this-but-thats, burying the lede, and other nonsense. I genuinely wonder if the people inside Anthropic actually communicate with each other like that. Has it been imprinted with Dario’s engrams? jp57 坦白说,Claude(尤其是它)的写作能力很糟糕。现在有一整套相关的技巧和CLAUDE.md指令试图让它写得更好,但每次新模型迭代似乎都刻意推翻这些努力,让它的写作充斥着不必要的分词短语、不是这个而是那个的句式、埋没重点以及其他废话。 我真的很好奇,Anthropic内部的人平时是不是也这样交流。它是不是被烙上了Dario的印记? I-have-ADHD: A skill to stop coding agents from bu… # https://news.ycombinator.com/item?id=49614114 You’ve identified a load-bearing problem and it’s worth naming bgilroy26 你发现了一个承重问题,值得命名。 iPhone Duo # https://news.ycombinator.com/item?id=49631500 Why do they insist on every new phone being bigger than the phones before them? I don’t mind folding. I think it’s cool, and a nice way to get a useful space. But I have big hands, and I can’t use my iphone 17 now without two hands. This is even wider before unfolding. Who wants bigger phones? Who is like, “damn I wish I had a tablet that I could fold up and still barely fit in my pocket”? I want smaller phones. The width of the iPhone 4 was nearly perfect imo. If they would take modern display technology with approximately that width and expand it to 16:9, I think it would kill, even if it were relatively underpowered compared to the modern top of the line. MPSimmons 为什么他们坚持每款新手机都要比前一代更大? 我并不反感折叠设计。我觉得这很酷,也是一种巧妙利用空间的方式。但我的手很大,现在用iPhone 17已经没法单手操作了。而这手机展开前甚至更宽。 谁会想要更大的手机?谁会觉得“真希望有台平板,折起来勉强能塞进口袋”? 我想要更小的手机。iPhone 4的宽度在我看来几乎完美。如果用现代显示技术做到差不多的宽度,再扩展到16:9比例,我觉得会很受欢迎——哪怕性能远不如当下的旗舰机。 Shopify acquires Tailwind # https://news.ycombinator.com/item?id=49627069 I made this point at the time but Tailwind Labs’ business model shouldn’t exist. It irks people because they wanna blame AI for it but they were coasting and should be happy it lasted this long. Tailwind’s business model existed due to a massive inefficiency in the frontend industry not being able to come to terms with CSS or native components. They surfed the wave of JS frontends becoming ever more complicated. If it wasn’t AI and just a human awakening to that fact, realizing that the complexity of modern frontends and Tailwind are not an absolute necessity, they’d have lost business just the same. There are dozens of different ways of writing frontends that have nothing to do with Tailwind. Providing ready-made UI components and templates has never been a million-dollar business, nor should it be. dlisboa 我当时就提出过这个观点——Tailwind Labs的商业模式本就不该存在。这件事之所以惹人反感,是因为人们想归咎于AI,但他们其实一直在吃老本,能撑到现在就该偷着乐了。 Tailwind的商业模式之所以能成立,完全是由于前端行业存在一个巨大的效率漏洞:始终无法与CSS或原生组件和解。他们不过是乘着JavaScript前端框架日益复杂的浪潮起势罢了。就算没有AI,只要人类幡然醒悟——意识到现代前端架构和Tailwind的复杂性并非绝对必要——他们的业务照样会完蛋。写前端的方式有几十种,跟Tailwind八竿子打不着的比比皆是。 提供现成的UI组件和模板从来就不是能赚大钱的生意,本来也不该是。 Claude, change the “Add to Cart” button to blue # https://news.ycombinator.com/item?id=49626658 You were right to push back. It’s not an accurate representation of claude. It’s satire. lancebeet 你反驳得对。这并非对克劳德的准确描述,这是讽刺。