这个 TasteVal 把研究品味换算成省了多少算力来打分,Opus 5.5 用 1/30 的成本跑赢人类专家,数字挺有意思的。
OpenAI 公开 722 篇 AI 数学论文,Mistral 万亿参数 Large 4 预览版登场
2026年10月7日,今日 AI 领域由前沿模型与能力边界主导:OpenAI 公开内部模型生成的 722 篇数学论文(约 160 篇含 Lean 形式化证明),解决了包括纳维-斯托克斯方程在内的约 4000 道题;Mistral 发布 Large 4 预览版,1 万亿参数(活跃 490 亿),用 3,800 台 Grace Blackwell GPU 训练,较 Large 3 显著提升但仍落后 DeepSeek 4.1 Flash;Reka 推出 190 亿参数多模态推理模型 Rho-1。第二大主题是研究智能体与评测:TasteVal 基准显示 Opus 5.5 的实验设计品味超过 24 名人类专家,Meta 发布长程研究智能体架构 MIRA,OpenAI Web Search 以 74 分登上搜索榜第 5。第三,训练与效率方法密集涌现:OPD 蒸馏让单次生成超越 64 候选 power sampling,起始 token 提示即可让 Olmo-3-7B 的 MATH-500 准确率从 42% 升至 78%,PyTorch 用 FBTriton 将推荐模型后向速度提升 2 倍。
模型发布/更新
5 篇Mistral 放出了 1T 总参、49B 激活的多模态模型预览版,说是欧美最强开源权重模型,月底连权重一起放出来,做开源部署的可以盯着。
DeepSeek 的 V4.1 Flash 跑分出来了,ARC-AGI-2 拿下 72.9%,比上一代高了 11.5 分,不过每任务成本贵了两倍多,看你怎么权衡。
产品发布/更新
5 篇Anthropic给不同信任级别的安全团队分级开放Claude Mythos 5.1,GLM-5.3已被证明能生成接近Mythos的漏洞。
OpenAI 把搜索直接内置进 API 了,Artificial Analysis 实测便宜过 Perplexity,但多跳检索还打不过 Octen,做联网应用前先看看这份数据。
Google 的 Nano Banana 2.1 上线了,1K 图约 3 美分一张,4K 也才 7 美分,做图的成本又降了。
行业动态
5 篇DeepSeek 这轮可能融到 120 亿美元以上,估值 710 亿,还要买 16 万块华为芯片建数据中心,腾讯宁德时代都跟投了。
Anthropic 5180 亿美元算力账单细节曝光,八成闲置也要付,Broadcom 独占 1612 亿,创始人还设计了 IPO 后不受股东制约的投票结构。
论文研究
5 篇一篇有意思的论文:不靠每次采样几十个候选,而是把 power sampling 的锐化直接蒸进模型,单次生成就超过 64 候选采样,数学和代码基准都有实测数字。
不用 RL 训练,只在开头加个 "Okay" 就能让 Olmo-3-7B 数学成绩翻近一倍,这篇论文把原因挖得很透,做模型训练的值得看看。
开源网页智能体训练时奖励信号太稀疏?这篇 CLIFT 用保形自验证把裁判反馈变成可复用信号,测试时还能不调 API 就做轨迹筛选,WebArena Infinity 上开源里最強。
技巧与观点
3 篇AWS 出的手把手教程,教你用 OpenClaw 加 AgentCore 的 memory 功能做一个能记住你、越用越懂你的个人助手,适合动手党。