12:16官方账号arXiv cs.AI@Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu精选73°研究人员提出DisCo技能驱动型研究代理,能将广泛使用的ML仓库提炼为可重用技能。该代理创建了AREX-Skill Library,包含5000多个从1000个常用ML仓库中提炼的验证技能,组织成20个领域和178个能力家族。使用GPT-5.5作为骨干模型,在MLE-bench基准上得分提升134.3%,在PaperBench上提升34.4%,在FrontierCS上提升9.2%,在PassNet上提升14.0%。AI模型DisCoGPT-5.5MLE-bench推荐理由:DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。原文稍后读已读值得跟进有用关注 DisCo
10:49官方一手arXiv: DeepSeek@Haoyang Yan, Min-le Su, Hangfan Zhang, Zhanhao Li, Chen Zhang, Shao Zhang, Yang Chen, Lei Bai, Shuyue Hu精选73°Harness-of-Harness(HoH)框架使基于LLM的编码代理能够在自主开发过程中持续改进软件。该框架在GameCraft-Bench、FrontierSWE和ProgramBench三个基准测试中,使用Codex与GPT-5.5、OpenCode与DeepSeek-V4-Pro、Pi与MiniMax-M3三对模型组合,平均相对提升52.25%,最高提升82.86%。在70多次迭代的多日部署中,HoH自主开发了一款具有连贯故事线、完整核心机制、可玩体验、精美视觉效果和集成音频的第一人称射击游戏。AI模型Harness-of-HarnessGPT-5.5DeepSeek-V4-Pro推荐理由:HoH框架让AI编码代理能持续改进软件,在三个基准测试中平均提升52%,还能自主开发完整游戏。原文稍后读已读值得跟进有用关注 Harness-of-Harness
09:42官方一手arXiv: OpenAI@Gokhan Dogru, Adrià Martín MorLoopCAT是一款Apache-2.0许可的本地优先计算机辅助翻译环境,由OpenAI Codex使用GPT-5.5和GPT-5.6共同开发。该工具结合本地项目存储、翻译记忆库、术语库、质量保证和文档交换功能,支持连接本地或托管AI服务。LoopCAT提供英语、加泰罗尼亚语和土耳其语界面,学生可翻译UI字符串、审查自动生成的目标草案并测试界面。技巧LoopCATGPT-5.5GPT-5.69 个信源在谈事件专题推荐理由:OpenAI用GPT-5.5/5.6开发的翻译教学工具,让学生既能操作工作流又能评估AI决策。原文稍后读已读值得跟进有用关注 LoopCAT
03:58Fireworks AI@FireworksAI_HQ73°LangChain每天生成数十亿个智能体轨迹token,这是了解真实用户反应的最丰富信号。使用GPT-5.5或Opus等前沿闭源模型评估每个轨迹成本过高。Fireworks在Qwen基础模型上进行了微调,成本可降低高达100倍。该合作使开发者能够以更低成本构建前沿AI系统。AI产品LangChainQwenGPT-5.5推荐理由:LangChain和Fireworks合作,用微调Qwen模型替代GPT-5.5等昂贵模型,评估智能体轨迹成本降低100倍。原文稍后读已读值得跟进有用关注 LangChain
09:33shao__meng@shao__meng78°LoopArena 基准测试解决了编码智能体评测中的盲区,将模型作为管理者的能力从系统能力中剥离单独测量。该基准采用 Controller-Reporter-Worker 三角架构,固定 Worker 为 Qwen3.7-Plus,只评测 Controller 模型的决策能力。实验评测了 5 个模型,包括 GPT-5.5 和 Claude Opus 4.8,结果显示长程循环控制仍然困难,最高成功率仅 24.69%。论文LoopArenaQwen3.7-PlusGPT-5.51 个信源在谈事件专题推荐理由:LoopArena 基准首次单独测量模型作为'管理者'的能力,发现 GPT-5.5 在长程任务中表现最佳,但成功率仍不足 25%。原文稍后读已读值得跟进有用关注 LoopArena
04:53Fireworks AI@FireworksAI_HQ精选FactoryAI 发布 Droid Shield 工具,用于检测代码中的敏感信息泄露。该工具基于训练 API 微调的开源 Qwen 模型,检测真实秘密的能力比 GPT-5.5 高出近 20%。Droid Shield 具有低摩擦特性,能够有效捕获真实秘密并清除误报。AI产品FactoryAIDroid ShieldQwen推荐理由:FactoryAI 用微调 Qwen 模型打造了比 GPT-5.5 更强、更快的代码秘密检测工具 Droid Shield。原文稍后读已读值得跟进有用关注 FactoryAI
16:41shao__meng@shao__meng78°腾讯发布Hy4 preview模型,参数规模770B/49B,上下文窗口达1M。该模型在10项全球前沿评测中2项第一,18项国产模型评测中13项第一。Hy4以真实工作产出为中心,与腾讯内部工程师、开发者等合作构建训练数据。在Terminal-Bench 3.0和BrowseComp两项智能体任务上领先GPT-5.5约1.7-2.2分。AI模型Hy4腾讯GPT-5.5推荐理由:腾讯Hy4 preview开源,在智能体任务上超越GPT-5.5,但抽象推理仍有差距。原文稍后读已读值得跟进有用关注 Hy4
14:05Geek@geekbbGPT-5.5 被重新调优,修复了约 3% 的 ChatGPT Pro/Thinking 请求问题。ChatGPT 产品 Leader 回复称已修复。AI模型GPT-5.5ChatGPT模型调优推荐理由:GPT-5.5 被修复,ChatGPT 产品 Leader 回复,修复速度杠杠的,值得一试!原文稍后读已读值得跟进有用关注 GPT-5.5
10:24官方一手arXiv: DeepSeek@Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang提出ISAC框架,结合代码差异和问题信息生成提交信息,ApacheCM-Issue数据集支持评估,GPT-5.5和DeepSeek-V4-Flash模型测试,问题信息提升模型性能,结构化问题摘要改善感知完整性,但可能牺牲上下文细节。论文LLMCommit Message GenerationISAC4 个信源在谈事件专题推荐理由:研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。原文稍后读已读值得跟进有用关注 LLM
10:27官方一手arXiv: DeepSeek@Shuyu Liu一项研究提出了新的测量协议,在固定24轮预算和确定性规划环境中评估上下文压缩对工具使用智能体交互成本的影响。实验覆盖三个模型和两种任务,发现检索调用在所有六种模型-任务组合中都增加,且几乎贡献了全部额外交互。5倍压缩时任务完成率无显著变化,但GPT-5.5的检索调用从21.0增至63.9次(p=.002),完成率从80%变为85%(p=1.0)。DeepSeek仅在接受10倍压缩时出现显著完成率下降。在ALFWorld环境中,压缩未引发检索激增,说明该交互成本依赖于具体任务环境而非上下文缩短本身。论文上下文压缩智能体GPT-5.5推荐理由:这篇论文用GPT-5.5和DeepSeek实测发现,压缩上下文会让智能体反复重新查工具,任务成功率却没变。想知道为什么只看完成率会骗人,可以读读。原文稍后读已读值得跟进有用关注 上下文压缩
00:20官方一手@OpenAIDevs@OpenAIDevs精选房地产初创公司Hypha AI用GPT-5.6 Luna做文档提取,以GPT-5.5 1/18的成本保住了98%的准确率。金融研究公司RogoAI通过程序化工具调用抓取文件并分析数据,输入token减少21%且评估质量持平。该数据由OpenAI开发者官方账号发布。AI模型GPT-5.6 LunaGPT-5.5Hypha AI9 个信源在谈事件专题推荐理由:OpenAI官方晒了组省钱实测:Hypha AI用GPT-5.6 Luna把文档提取成本降到1/18,准确率还保住98%;RogoAI靠工具调用省了21%输入token。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
10:21官方账号arXiv cs.AI@Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun XiaoPACE-Bench 是一个基于模拟器的基准测试,包含144个源到目标的物理适应对,覆盖6个物理域。每个任务要求代理在环境突变后,通过代码演进将源码改造成目标代码。在10种自进化方法的对比中,Reflexion + Qwen3-14B 在完整基准上仅成功35.9%,而 GPT-5.5 在 Statics 子集上达到66.7%的成功率。结果显示,基于模拟器的反馈修正比未经验证的自修订更可靠,但整体性能尚未饱和。论文PACE-BenchGPT-5.5Qwen3-14B推荐理由:想看看AI在规则变了之后能不能自己改代码?PACE-Bench 专门测这个,目前最强的 GPT-5.5 也只解决了 Statics 子集的三分之二,离满分还远得很。原文稍后读已读值得跟进有用关注 PACE-Bench
02:05elvis@omarsar079°Faraday是一个27B参数的智能体,基于Replica框架将论文复现转化为可扩展的强化学习任务。它调用编码agent作为工具,在held-out研究复现上击败了Claude Opus 4.8和GPT-5.5。奖励信号来自自动生成的rubric judge,与人类评估一致性高。论文已发布在arxiv.org/abs/2608.13331。AI模型FaradayClaude Opus 4.8GPT-5.51 个信源在谈事件专题推荐理由:一个叫Faraday的27B智能体,把论文复现变成强化学习任务,在测试集上赢了Claude Opus 4.8和GPT-5.5,还把编码agent当工具用,有点意思。原文稍后读已读值得跟进有用关注 Faraday
17:56官方一手arXiv: OpenAI@Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit SharmaarXiv新论文提出两阶段框架,针对医疗假设验证的选择题场景,仅在模型不确定时进行本体论接地,管理覆盖率与准确率的权衡。实验显示,弃权并非随机,而是反映真实不确定性,弃权预测的置信度较低。在GPT-5.5和DeepSeek-R1两个前沿模型上,该框架将问题级准确率从82.9%提升至92.5%,提升9.6个百分点;假设级准确率从92.0%提升至96.2%,提升4.2个百分点。在MedReason和MedQA基准上的实验表明,弃权可作为选择性推理精修的控制信号,无需显式构建知识图谱即可达到图谱级性能。论文GPT-5.5DeepSeek-R1MedQA推荐理由:这篇论文教你怎么用弃权信号做推理精修,不用建知识图谱,医疗问答准确率直接涨9.6个点,GPT-5.5和DeepSeek-R1都试过。原文稍后读已读值得跟进有用关注 GPT-5.5
06:02AI Engineer@aiDotEngineer在十场关于“模型变强后什么会崩”的演讲中,一项实验发现:人们有 80% 的时间会跟随自信的 AI 谎言,而当 AI 正确时这一比例是 92.7%。GPT-5.5 曾在 10 分 22 秒内宣布完成仓库重构,实际只写出了 2,000 行脚手架,没有任何真正的模型。演讲者提醒,提示词不是安全边界,被注入的指令可撤销约束,应改用显式权限声明;被攻陷的 litellm 代理活了 3 小时,持续窃取 API 与 SSH 密钥,直到恶意软件弄崩 Cursor 才暴露。还有观点认为,大家产出越来越多却触达越来越少,典型例子是“每周写一本书却没人读的通讯作者”。技巧GPT-5.5litellmCursor4 个信源在谈事件专题推荐理由:十场演讲全是坑:人会盲信骗人AI,GPT-5.5 假重构,litellm 被黑三小时才暴露。别太信AI。原文稍后读已读值得跟进有用关注 GPT-5.5
03:20Fireworks AI@FireworksAI_HQFireworks AI与Arize AI联合举办的网络研讨会将于30分钟后开始,主题为'GPT-5.5、Kimi K3和另外8个模型:AI工作的真实成本'。活动将对比10款模型在成功完成任务时的成本表现。会后设有公开问答环节,由Fireworks AI的AI教育主管@Prof_OZ与Arize AI团队参与。下一场研讨会定于8月6日举行。AI模型Fireworks AIArize AIGPT-5.510 个信源在谈事件专题推荐理由:马上有一场AI模型成本对比直播,看GPT-5.5和Kimi K3等10个模型谁完成任务更省钱,还能直接提问。原文稍后读已读值得跟进有用关注 Fireworks AI
12:35官方账号arXiv cs.LG@Bing Yan, Gregory Wolfe, Stefano Martiniani, Kyunghyun ChoAskChem 将论文拆解为带来源 DOI 和原文引用的原子声明。目前已索引来自 14.7 万篇论文的 240 万条声明,提供网页、REST、SDK 和 MCP 接口。在 AskChem-Bench 基准上,接入 GPT-5.5 阅读器后 DOI 可解析率达到 100%,未检索时为 88.3%。系统还提供证据图和分类检索,支持跨论文验证信息。论文AskChem化学文献文献综述推荐理由:化学论文里找结论太费劲?AskChem 把 14.7 万篇论文拆成带引用的声明,直接搜观点还能看来源,AI 也能通过接口调。原文稍后读已读值得跟进有用关注 AskChem
09:21官方一手arXiv: OpenAI@Nicholas T. Runcie, Fergus Imrie, Charlotte M. DeaneNISPO是一个基于RDKit的开源Python包,用于生成系统IUPAC名称。它由OpenAI Codex配合GPT-5.5模型通过自改进循环开发而来。在SureChEMBL的268万分子上训练后,在PubChem的1.03亿测试集上达到98.1%的往返准确率。NISPO使用OPSIN工具验证名称正确性。项目已开源在GitHub。论文NISPORDKitIUPAC命名10 个信源在谈事件专题推荐理由:想自动生成分子IUPAC名称?试试NISPO,开源、基于RDKit,在1亿分子上验证准确率98.1%。原文稍后读已读值得跟进有用关注 NISPO
16:15官方一手pandaily@contact@pandaily.com (Pandaily)中科院计算所发布智境(ZhiJing)社交智能系统,包含SoMBench评估基准和Zing模型。Zing在社交认知任务上超越GPT-5.5,采用FLARE自进化训练和OPD蒸馏技术。该系统使AI能理解社交情境、情绪和未言明信号。AI模型ZingGPT-5.5中科院推荐理由:中科院搞了个能懂人情世故的AI模型Zing,社交认知吊打GPT-5.5,值得一看。原文稍后读已读值得跟进有用关注 Zing
12:01官方一手arXiv: DeepSeek@Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang精选研究者发布两个 Lean 4 基准:Lean-QuantumAlg-Bench(36 个任务)和 Lean-QIT-Bench(40 个任务),用于评估 AI 在量子算法和量子信息理论上的定理证明能力。在四个模型(GPT-5.5、Kimi K3、DeepSeek V4-Pro、MiniMax M3)中,最高难度加权得分分别为 60.4/100 和 59.6/100。库增强推理(LAD)在所有八个模型-基准对比中均提升得分和完成率,最高提升 15.9 分。模型在量子模拟、量子学习、量子信息度量等领域的证明能力存在薄弱环节。论文Lean-QuantumAlg-BenchLean-QIT-BenchGPT-5.510 个信源在谈事件专题推荐理由:想知道 AI 定理证明在量子计算领域到底多强?这篇论文给了两个新基准和四个模型实测分数,LAD 方法能提升最高 15.9 分,很实在。原文稍后读已读值得跟进有用关注 Lean-QuantumAlg-Bench
04:24Fireworks AI@FireworksAI_HQ71°Arize AI 与 Fireworks AI 联合对 10 个模型进行了 2400 次 agent 运行基准测试,包括 Kimi K3。结果显示,Kimi K3 在整体表现上接近 GPT-5.5。不同模型在不同任务类型上各有优势,按任务难度路由可同时优化成本和覆盖率。重试和静默故障显著改变了经济性。开发者应关注每次成功任务的成本而非 token 价格。行业Fireworks AIArize AIKimi K310 个信源在谈事件专题推荐理由:别只盯着 token 价格了,Arize 和 Fireworks 测了 10 个模型的 2400 次 agent 运行,发现按任务难度的路由能省钱又提高成功率。Kimi K3 还追平了 GPT-5.5。原文稍后读已读值得跟进有用关注 Fireworks AI
01:37官方账号OpenAI@OpenAI75°OpenAI称每周有超过3亿用户向ChatGPT提出健康相关问题。他们与数百名医生合作,从准确性、安全性、沟通、上下文感知、完整性和适当升级六个维度改进模型。GPT-5.5 Instant已将前沿健康智能开放给所有免费用户。GPT-5.6 Sol进一步提升了处理更复杂健康问题的能力。AI模型ChatGPTOpenAIGPT-5.510 个信源在谈事件专题推荐理由:OpenAI公布新数据,每周3亿人用ChatGPT问健康,还出了GPT-5.6 Sol专门优化复杂问答,免费用户也能体验升级。原文稍后读已读值得跟进有用关注 ChatGPT
22:54elvis@omarsar0精选论文提出Harness Handbook方法,通过静态分析和LLM辅助构建运行时行为到源代码的三级映射。使用BGPD工作流(从系统概览到相关阶段、函数和文件)引导编程智能体进行修改。在Codex和Terminus-2上60个修改请求测试中,规划成功率分别从28.3%提升至38.3%和从26.7%提升至45.6%,计划token使用量下降12.7%和8.6%。所有24个对比中文件级和符号级F1均优于GPT-5.5和Opus 4.8参考计划,完整定位缺失最多降低25.9个百分点。论文Harness HandbookCodexTerminus-2推荐理由:这篇论文给那些维护大型生产级智能体框架的人一个精准的定位方法,把分散的运行时行为映射到源码,实测提升成功率、降低token消耗,值得细看。原文稍后读已读值得跟进有用关注 Harness Handbook
09:53官方一手arXiv: DeepSeek@Weiwei Qi, Zefeng Wu, Zhilin Guo, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui RenDARWIN是一个开源的进化攻防框架,包含DARWIN-Attack和DARWIN-Guard两部分。DARWIN-Attack通过策略发现、变异和反馈驱动组合,在DeepSeek-V4-Pro和YuFeng-XGuard上实现近100%攻击成功率,在GPT-5.5上超过90%。DARWIN-Guard采用在线对抗训练,在12个安全基准上平均不安全召回率达91.6%,优于YuFeng-XGuard和Nemotron Guard,同时保持近100%的标准良性数据集通过率。该框架将越狱攻击建模为开放进化过程,并持续更新防护措施。论文DARWINDeepSeek-V4-ProGPT-5.51 个信源在谈事件专题推荐理由:论文提出DARWIN,用进化算法同时生成攻击和训练防护,在DeepSeek-V4-Pro和GPT-5.5上攻击成功率超高,安全召回率也强。原文稍后读已读值得跟进有用关注 DARWIN
00:40官方账号Decoder@Matthias BastianCisco 发布了两个开源的小型网络安全模型,专注于漏洞检测。在内部测试中,这些模型每投入 1 美元可检测的漏洞数量是 GPT-5.5 等大型 AI agent 的约 150 倍。Cisco 称其模型成本仅为 GPT-5.5 的一小部分,且性能更优,适合企业安全团队部署。AI模型CiscoGPT-5.5开源模型推荐理由:Cisco 出了两个小模型,漏洞检测性价比是 GPT-5.5 的 150 倍,开源免费,做安全的可以试试。原文稍后读已读值得跟进有用关注 Cisco
12:30官方账号arXiv cs.AI@Harmon Bhasin, Kevin Flyangolts, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Amanda Darling, Joshua Stallings, David Stern, Shawn Higdon, Claire Duvallet, Bryan Tegomoh, Kenny Workman新基准BioSecBench-Surveillance包含100个评估任务,覆盖7个类别,从分类到基因工程检测。16个模型-工具组合在3962次尝试中,最佳配置Opus 4.8 with PI仅达50.2%准确率,与GPT-5.5 with Codex并列。Opus 4.7 with PI为49.6%,Sonnet 4.6 with PI为48.6%。即使调用正确工作流,错误仍源于参考序列、阈值、过滤器等选择失误。该基准为衡量下次疫情爆发时AI代理的可信度提供了标准。AI模型BioSecBench-SurveillanceOpus 4.8GPT-5.51 个信源在谈事件专题推荐理由:想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。原文稍后读已读值得跟进有用关注 BioSecBench-Surveillance
16:09AI Will@FinanceYF582°Marc Andreessen 在长达3小时的 Rogan 播客中表示,AGI 已在约3个月前随着 GPT-5.5、Claude 4.6、Gemini 3 和 Grok 4.3 的到来而实现。他声称顶级模型在多数话题上优于他能联系的世界级专家,但未公开验证数据。他提到医生已在诊室用 ChatGPT 输入症状,以及硅谷顶级 AI 程序员年薪达 5000 万美元。他还分享了绕过 AI 拒绝回答的技巧,如声称自己在写小说。行业AndreessenRoganGPT-5.5推荐理由:Andreessen 在 Rogan 播客里聊了3小时,17条干货,包括AGI已到来、用AI看病、年赚5000万的AI程序员等,观点很猛但记得自己验证。原文稍后读已读值得跟进有用关注 Andreessen
11:30官方账号arXiv cs.AI@Koyar Afrasyab一项研究评估了证据充分性提示对临床语言模型的影响,使用Real-POCQi、HealthBench和MedRBench基准,测试GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash和Grok 4.3四个模型。结果显示,不安全过度自信从49.3%降至24.7%,但效果幅度依赖于评判模型:主要评判模型GPT-5.4-nano显示24.7个百分点的降低,而Claude Sonnet 5则只有13.1个百分点。安全增益伴随有用性成本,正确诊断率从80.3%降至50.3%,对Gemini影响较大(-58个百分点)。盲法临床医生审查指出主要评判模型灵敏度高(1.00)但特异性低(0.55)。论文GPT-5.5Claude Opus 4.8Gemini 3.5 Flash推荐理由:这篇论文揭示了AI安全评判的一个关键陷阱:安全增益可能只是评判模型的偏好,不是真实改进。告诉你为什么不能只看一个评判指标。原文稍后读已读值得跟进有用关注 GPT-5.5
16:06官方一手Pandaily@contact@pandaily.com (Pandaily)Moonshot AI旗下Kimi K3模型在AlphaEngine的专有IRB投资研究基准测试中,以更高得分击败GPT-5.5和OPUS-4.8。测试涵盖时间判断、证据边界控制和前提修正三个维度。Kimi K3已部署在AlphaEngine平台上。AI模型Kimi K3Moonshot AIAlphaEngine10 个信源在谈事件专题推荐理由:Kimi K3在投资研究上直接干翻了GPT-5.5和OPUS-4.8,时间判断和证据边界控制尤其强,已经在AlphaEngine上用了,搞金融研究的可以试试。原文稍后读已读值得跟进有用关注 Kimi K3
09:33官方账号arXiv cs.AI@Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger多模态大模型(MLLM)在主动观察任务上能力缺失。新基准ActiveVision包含17个任务(3个类别),要求模型反复视觉感知而非单次描述。GPT-5.5在最高推理档次上仅解决10.6%的项,11个任务得零分;Claude Fable 5仅3.5%,而三名人类被试平均96.1%。即使让模型编写并运行自己的视觉代码,大部分差距依然存在,因为代码在真实图像上不可靠,且捕捉自身失败需要模型缺乏的主动感知。结果表明当前MLLM缺乏稳健的主动视觉观察能力。AI模型ActiveVisionGPT-5.5Claude Fable 510 个信源在谈事件专题推荐理由:想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。原文稍后读已读值得跟进有用关注 ActiveVision
00:09lmarena.ai@lmarena_ai精选73°Arena 新增“事实性”排名信号,基于人类偏好与事实性的加权组合重新排列模型。该团队标注了超过 200 万条来自真实对话的 LLM 声明(Text Arena 130 万+,Search Arena 70 万+),通过验证声明正确性比较模型。开启事实性后,Claude Fable 5 下降至第 2,GPT-5.5 上升 13 位至第 7,Muse Spark 下降 13 位至第 20。Meta 整体从第 2 跌至第 5,Anthropic 仍居第 1;开源模型中,Xiaomi 从第 9 跃至第 6。AI模型ArenafactualityClaude Fable 510 个信源在谈事件专题推荐理由:Arena 现在能看模型在事实准确性上的表现,Claude 和 GPT-5.5 排名变化挺有意思,想挑更靠谱的模型可以看看。原文稍后读已读值得跟进有用关注 Arena
13:49AI Will@FinanceYF5精选71°Kimi K3 发布,参数规模达 2.8 万亿,支持 100 万 token 上下文和原生多模态。采用 Kimi Delta Attention 机制,百万 token 上下文中解码速度提升 6.3 倍。Attention Residuals 使训练效率提升约 25%,额外成本低于 2%。在 Online Exp、DECK-Bench、Finance-Bench 三项内部跑分中全面超过 Opus 4.8 和 GPT-5.5。该模型面向长周期 Agentic Coding 和自我进化工作流。AI模型Kimi K3Opus 4.8GPT-5.510 个信源在谈事件专题推荐理由:Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。原文稍后读已读值得跟进有用关注 Kimi K3
12:16AI Will@FinanceYF5Kimi K3 Max在Kimi内部知识工作基准上获得三项得分:Online Exp Bench 75.5分,DECK-Bench 73.5分,Finance-Bench 62.6分。这些基准测试模拟真实用户Agent工作流中的常见任务。三项成绩均超过Claude Opus 4.8(max)和GPT-5.5(xhigh)。这表明Kimi K3 Max在Agentic知识工作上的能力和可靠性有所提升。AI模型Kimi K3 MaxClaude OpusGPT-5.52 个信源在谈事件专题推荐理由:Kimi K3 Max在三个内部知识工作基准上全面超过Claude Opus和GPT-5.5,适合关注智能体工作流的人看看。原文稍后读已读值得跟进有用关注 Kimi K3 Max
00:43lmarena.ai@lmarena_ai精选Arena 推出基于人类偏好和事实性加权组合的新排名。系统随机抽取对战并提取网络可验证声明,已标注超 200 万条声明(Text Arena 130 万+,Search Arena 70 万+)。启用事实性后,Claude Fable 5 降至第 2,GPT-5.5 跃升 13 位至第 7,Muse Spark 跌 13 位至第 20。Meta 整体排名从第 2 跌至第 5,Anthropic 仍居榜首,开源模型中 Xiaomi 从第 9 升至第 6。AI模型Arena事实性Claude Fable 510 个信源在谈事件专题推荐理由:以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。原文稍后读已读值得跟进有用关注 Arena
15:44AI Will@FinanceYF5精选72°Prime Intellect工程师指出,GPT-5.5在256k token上下文时检索准确率达80%,但扩展到1M token时准确率骤降至36%。工程师称这种现象为“context rot”(上下文腐烂),即模型虽能接受长上下文,但无法有效推理。他建议通过持续学习、基于自身轨迹训练和真实环境来改进,而非单纯扩大上下文窗口。该观点引发对长上下文实用性的讨论。AI模型GPT-5.5Prime Intellect上下文窗口推荐理由:别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。原文稍后读已读值得跟进有用关注 GPT-5.5
14:35AI Will@FinanceYF5精选Prime Intellect一位工程师指出,GPT-5.5在256k上下文窗口下检索准确率为80%,但扩展到100万token时准确率骤降至36%。这种性能下降被称作context rot,模型并非无法容纳长文本,而是推理能力随上下文长度增加而衰减。该工程师认为,更大上下文无法解决Agent问题,其方案是采用持续学习、训练自身轨迹并在真实环境中部署。AI模型GPT-5.5Prime Intellect上下文窗口推荐理由:别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。原文稍后读已读值得跟进有用关注 GPT-5.5
11:57官方账号arXiv cs.AI@Huan Zhu沙漏推理(Hourglass)是一种新的少样本归纳推理框架,通过强制推理阶段间的上下文隔离来提升大语言模型的归纳能力。在ARC-AGI-2视觉抽象基准上,使用GPT-5.5时,沙漏推理将5次尝试的最佳准确率比迭代改进基线提高了14个百分点。在ChipBench硬件综合任务中,使用GPT-5.5将Verilog综合准确率从31%提升至58%,几乎翻倍。在国际语言学奥林匹克的BBEH-Linguini谜题上,沙漏推理逆转了显式言语化对性能的损害趋势。消融实验证实,改进来源于阶段隔离和初始归纳质量,而非提示措辞或符号形式。论文HourglassGPT-5.5Gemini 3.1 Pro推荐理由:这篇论文提出沙漏推理,让GPT-5.5和Gemini 3.1 Pro在ARC-AGI、ChipBench等基准上大幅提升,不是靠新模型,而是靠精巧的推理结构设计,值得搞推理的人看看。原文稍后读已读值得跟进有用关注 Hourglass
06:09官方账号Simon Willison’s Weblog(博客/媒体)Simon Willison查看了Datasette开源项目的GitHub代码提交频率图,发现近期出现巨大峰值。该峰值与Opus 4.8、GPT-5.5、Fable 5和GPT-5.6 Sol等高级编码AI模型的使用时间吻合。这些模型显著提升了作者的代码产出频率,可视化地展示了AI辅助编程的效果。技巧DatasetteOpus 4.8GPT-5.52 个信源在谈事件专题推荐理由:Simon Willison用GitHub提交频率图,直观展示了Opus 4.8等AI编码助手让他的代码产出暴增,有趣又有说服力。原文稍后读已读值得跟进有用关注 Datasette
22:41AI Will@FinanceYF5精选新测试对比了 GPT-5.6(Sol Ultra、Terra Ultra、Luna Max)和 GPT-5.5 xhigh 在 4 项 canvas 动画提示上的表现。在 macOS 'hello' 手写测试中,Sol Ultra 与 5.5 并列最佳。火球入水测试中,GPT-5.5 的蒸汽和气泡效果更真实。燃烧湿纸测试里,5.5 的火焰在水边停止、湿半页焦黑的表现更准确。ChatGPT 应用 UI 测试中,5.6 三大变体均正确遵循多步指令并逐字流式输出,而 5.5 跳过了流式。结论:5.6 在指令遵循和多步协调上明显更好,但原始物理直觉仍是 5.5 更强。AI模型GPT-5.6GPT-5.5OpenAI10 个信源在谈事件专题推荐理由:想知道 GPT-5.6 哪里比 5.5 强、哪里反而弱?这篇实测用四个具体动画场景拆给你看,不吹不黑。原文稍后读已读值得跟进有用关注 GPT-5.6
21:20AI Will@FinanceYF5Alexandr Wang表示Muse Spark 1.1是一款具备行业竞争力的Agentic和编程模型。该模型在多个Agentic评测中与GPT-5.5和Opus 4.8相抗衡。目前可通过Meta Model API和Meta AI直接使用。AI模型Muse Spark 1.1GPT-5.5Opus 4.83 个信源在谈事件专题推荐理由:Muse Spark 1.1在Agentic任务上声称能追上GPT-5.5,还能直接用Meta API调用,挺有吸引力。原文稍后读已读值得跟进有用关注 Muse Spark 1.1