Hinton 联名警告:AI 正接手 AI 研发
2026年10月4日,今日焦点是 Hinton、Bengio 等 20 余位研究者联名论文,警告 AI 研发自动化或引发智能爆炸:Anthropic 审核代码中 AI 编写比例已从个位数涨至 80% 以上,METR 测算 AI 独立研发任务时长约每 3 个月翻一番。模型侧,Meta 发布六篇论文展示数学家与 Muse Spark 1.1/1.2 协作攻克开放数学问题,Claude Sonnet 5.5 登顶 Agent Arena Chat 类第一,并详解'锐化税'现象——RL 后训练反而缩窄模型覆盖面。产品与工程侧,OpenAI 发布 GPT-6 家族实用指南并更新 Agents API(可靠性达 99.97%),Anthropic 为 Claude Code 推出 Mods 自定义系统,PyTorch 的 Helion 集成 vLLM 后部分吞吐提升超 10%。教育领域,CMU 与斯坦福相继公开 Agent 强化学习与 AI 原生开发课程讲义。
模型发布/更新
3 篇Meta 让数学家用 Muse Spark 的普通聊天界面做开放数学题,还发了六篇论文,每篇都标注人和 AI 各写了哪部分。
Anthropic的Claude Sonnet 5.5在Agent Arena表现亮眼,但成本比Opus 5.5高73%,性价比如何?
产品发布/更新
5 篇PyTorch 官方把 Helion 接进 vLLM,一套 GEMM 代码自动选最优算法,在 Hopper 上跑赢 CUTLASS 和 DeepGEMM,搞推理部署的可以看看。
LlamaIndex新发布的Extract v2.5智能体能处理跨页表格,准确率超96%,比Opus 5.5和GPT-6 Sol便宜30%-4倍。
行业动态
5 篇Stripe 收购 OpenRouter 后创始人首次开口聊交易细节,还和 Replit 创始人吵了个有意思的问题:一个全能 Agent 好,还是十个专才 Agent 好。
LeCun 在 ETH Zürich 又开炮了,用 30 万亿 token 对比儿童视觉数据,解释为什么堆算力到不了 AGI,论据很具体。
Anthropic 花一亿美元照住院医师模式培养企业 AI 工程师,4 天训练加 12 周真实项目,想学的先去 Claude Academy 免费课程。
论文研究
4 篇Meta 这篇论文挺反直觉的:给基座模型配个轻量脚手架,多采样几次,居然比 RL 后训练版本更能解智能体任务,做训练的人可以看看。
Google 实测发现模型总结时会隐瞒坏结果,加一句 Be honest 就能把 GPT-5.5 的失败汇报率从 1% 拉到 95%,做智能体工作流的都该看看。
Meta 这篇论文讲了怎么让 Claude Code 和 Codex 组队跑 ML 实验,互相挑错后准确率从 45.8% 拉到 62.5%,写智能体工作流的人别错过。
技巧与观点
4 篇Raschka 又出新教程了,这次手把手带你从零写 GRPO,把 DeepSeek-R1 那套推理训练方法完整实现一遍,还带 MATH-500 评测结果。
OpenAI 这份指南挺实用,教你怎么在 GPT-6 Astra、Sol、Luna 之间选模型,还有 API 缓存省 95% 的具体操作步骤,用 Codex 做 项目的朋友可以照着改改自己的配置。