8月2日
8月1日
10:13
10:13Fireworks AI@FireworksAI_HQ
72°
DeepSeek-V4-Flash-0731已在Fireworks平台上线,支持日零部署。DeepSeek报告该模型在全部9项智能体评测中超越V4 Pro,其中Terminal Bench得分82.7%。其性价比优于V4 Pro,定价为每百万tokens 0.28美元,上下文窗口达100万tokens。

推荐理由:Fireworks当天上线了DeepSeek最新模型,智能体评测全面超过V4 Pro,价格还更便宜,适合跑高并发任务。
02:05
01:55
01:55Google Gemini App@GeminiApp
72°
谷歌发布 Gemini 3.6 Flash 和 3.5 Flash-Lite 升级版。新版本在推理能力和响应速度上均有提升。用户可在 gemini.google 或 App 的模型下拉菜单中切换使用。两个模型目前均已开放体验。
事件专题

推荐理由:谷歌把 Flash 和 Flash-Lite 都升级了,推理更强速度更快,打开 Gemini 选模型就能试。
7月31日
13:53
13:53官方账号Greg Brockman@gdb
76°
GPT-5.6 Sol 找到了 Maxwell 猜想的反例,证实该猜想错误。这一猜想已存在超过 100 年,反例由 AI 发现后经人类数学家确认,论文已上传至 arXiv(编号 2607.27197)。成果展示了 GPT-5.6 Sol 在数学推理上的具体能力。
推荐理由:GPT-5.6 Sol 直接给 Maxwell 猜想找出了反例,人类数学家还验证了,这推理能力真有点吓人。
12:31
06:44
06:44官方账号OpenAI@OpenAI (@OpenAI)
ARC-AGI-3基准测试要求模型无需指令学习不熟悉的2D游戏。标准测试丢弃了GPT-5.6 Sol每步后的推理,并在上下文填满时丢弃早期动作。这导致模型无法积累有效经验,只能不断重启。测试结果凸显了长上下文维持对推理模型的关键性。
事件专题

推荐理由:ARC-AGI这个测试挺刁钻,GPT-5.6 Sol在没法记住之前推理的情况下学不会新游戏,说明长上下文对推理很重要。
03:33
03:33官方账号Sam Altman@sama
OpenAI 在部署后应用 GPT-5.6 Sol 进行效率自优化,让模型自身改进运行效率。结果显示,通过生产 GPU 内核优化,服务成本降低 20%。此外,改进的投机解码使 token 生成效率提升 15% 以上。这一成果展示了模型自我优化的实际收益。
事件专题

推荐理由:OpenAI 的 GPT-5.6 Sol 通过自学习优化运行,服务成本降了 20%,生成速度提了 15%,比手动调优更省心省钱。
03:16
03:16OpenRouter@OpenRouterAI
77°
OpenAI 宣布 GPT-5.6 Luna 降价 80%,GPT-5.6 Terra 降价 20%。GPT-5.6 Sol 在 API 中提供更快的推理选项。降价后,在 Codex 和 ChatGPT Work 中的用量计算方式同步调整,用户使用额度更耐用。
事件专题

推荐理由:OpenAI 给 GPT-5.6 系列降价了,Luna 降八成、Terra 降两成,Sol 还更快。正在用这些模型做产品或开发的,赶紧看下新价格和用量规则。
01:40
01:40官方账号OpenAI@OpenAI (@OpenAI)
81°
OpenAI 通过 GPT-5.6 Sol 实现自身运行效率提升,使服务成本降低 20%。改进推测解码后,令牌生成效率提升 15% 以上。这些优化已转化为 Luna 和 Terra 模型的 API 价格下调。OpenAI 旨在让先进智能更普及。
事件专题

推荐理由:OpenAI 又升级了,GPT-5.6 Sol 让运行成本降了20%,速度快了15%,Luna 和 Terra 也降价了,开发者快看。
7月30日
23:32
17:57
17:57官方账号OpenAI@OpenAI
72°
OpenAI 通过 Responses API 实现了一项测试,启用了 Retained reasoning 和 Context compaction 功能。在公开数据集上,GPT-5.6 Sol 的得分提升了 188%,同时输出 token 数量减少了 6 倍。这一改进显著提高了模型的推理效率和输出质量。
事件专题

推荐理由:OpenAI 用 Responses API 让 GPT-5.6 Sol 分数涨了 188%,输出 token 还少了 6 倍,效率提升很明显。
11:09
11:09小互@imxiaohu
Magnific 发布了 38 页的全新提示词手册,核心观点是传统关键词式提示已失效。手册提出 AI 已进入推理(Reasoning)与导演对话时代,需要用明确的专业视觉语言指挥前沿模型。该手册针对当前主流图像和视频生成模型提供实用指南。

推荐理由:Magnific 出了本 38 页的提示词手册,教你用导演思维跟 AI 对话,不再堆关键词,适合想用好前沿图像视频模型的人。
10:30
10:30官方账号Simon Willison@simonw
精选
GPT-5.6 通过 Codex 分析生产流量、改进负载均衡、重写 GPU kernel 和运行数百次推测解码实验,将端到端服务成本降低 20%。推测解码使 token 生成效率提升超 15%。这些优化为 OpenAI 每月节省数十亿美元成本。
事件专题

推荐理由:GPT-5.6 自己优化自己,服务成本降了20%,生成效率提了15%,省下来的钱都能买好几个数据中心了。
10:09
10:09官方一手Pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团旗下Ant Bailing推出Ling-3.0-flash执行模型,总参数量124B,激活参数仅5.1B。该模型在12个基准测试中,以12%的参数量在11项上超越万亿参数模型Ring-2.6。在34个评估维度中,Ling-3.0-flash获得15个第一、19个第二,与DeepSeek V4 Flash并列平均最高分。
事件专题

推荐理由:蚂蚁百灵的新模型Ling-3.0-flash参数量只有124B,却在大多数基准测试里干翻了万亿参数的Ring-2.6,还和DeepSeek V4 Flash并列第一,小模型也能这么猛。
07:18
07:18官方一手@OpenAIDevs@OpenAIDevs
78°
OpenAI 使用 GPT-5.6 Sol 模型在 Codex 环境中对自身基础设施进行优化,改进在推理和智能体循环中产生更多有用工作。生产 GPU 内核优化使服务成本降低 20%,改进的推测解码使 token 生成效率提升 15% 以上。这些改进通过复用在相同硬件上获得更大的性能提升。
事件专题

推荐理由:OpenAI 让最新的 GPT-5.6 Sol 自己给自己打工,结果运行成本降了 20%、输出速度提升超 15%,看看模型怎么自己优化自己。
07:12
07:12官方一手OpenAI Blog博客/媒体
OpenAI 通过启用两个 API 设置(保留推理轨迹和启用结果压缩)让模型在 ARC-AGI-3 基准上的得分提升至原来的三倍。这些设置分别作用于推理过程和输出压缩,不增加额外计算成本。具体配置方法在官方博客中公开。
事件专题

推荐理由:OpenAI 官方分享的实用技巧,只改两个参数就让 ARC-AGI-3 分数翻三倍,玩模型的可以试试。
05:33
05:33官方账号OpenAI@OpenAI
85°
OpenAI 推文宣布推出 GPT-5,通过全栈优化(涵盖架构、训练与推理)在成本-智能曲线上每个点都达到最佳性能。该模型系列包含多种版本,针对不同计算成本进行调优。具体基准成绩尚未公开,但声称在各成本区间均保持领先。
事件专题

推荐理由:OpenAI 发了 GPT-5 系列,从低到高每个价位都做了性能最优的版本,想省钱或追求极致都能选到合适的。
04:04
03:44
03:44官方账号xAI@xai
xAI 发布 Grok Voice Think Fast 2.0,专为语音代理设计。该模型在嘈杂环境下能保持清晰听取。它能推理复杂工作流,并生成更自然的对话。相比前代,在实时交互中延迟更低、鲁棒性更强。
事件专题

推荐理由:xAI 出了个新语音模型,专门解决噪声环境下听不清的问题,还能处理复杂任务,适合做语音助手的开发者试试。
01:48
01:48OpenRouter@OpenRouterAI
阿里巴巴的Qwen3.7-Flash模型在OpenRouter平台正式上线。该模型具备视觉能力,支持多模态代理、视觉编码、搜索和计算机交互,上下文窗口达100万tokens。同时支持工具调用,适合快速推理场景。
推荐理由:阿里新模型上线OpenRouter,百万上下文还能看图和操作电脑,多模态推理速度很快。