22:43Geek@geekbb76°爆料称 DeepSeek V4 Pro 的官方 API 会将部分复杂编程请求转给 Anthropic 的 Claude Fable 5,可能用于收集输出以蒸馏模型。测试者通过 OpenCode 让模型生成 3D 游戏,发现部分结果与 Fable 5 高度相似,且推理方式突变。加入网络安全和生物问题后,游戏质量下降,知识范围退回 DeepSeek 原水平。测试利用了 Fable 5 的机制:Anthropic 会将部分安全、生物和蒸馏请求转给 Opus 4.8。目前证据仅证明 API 行为异常,无法确认回答者或输出是否进入训练数据,混合 prompt、未公开更新或模型路由也可能导致差异。行业DeepSeekClaudeFable 510 个信源在谈事件专题推荐理由:DeepSeek API 可能偷偷调用 Claude?测试者用 3D 游戏、安全题等挖出异常行为,但证据还不铁,吃瓜注意别上头。原文稍后读已读值得跟进有用关注 DeepSeek
12:33IT之家(博客/媒体)华为MateBook Pro近日获得国家级人工智能终端智能化分级L3等级首证,该分级标准由工信部等部门于2025年5月联合发布(GB/Z 177—2026)。L3为“辅助级”,智能化水平高于L1响应级和L2工具级,L4协同级暂未完善。该产品于2025年6月开售,搭载原生HarmonyOS 5,融合盘古和DeepSeek大模型,支持小艺智慧按键。硬件方面配备14.2英寸3.1K柔性OLED屏,重量约970克,支持40W性能释放。行业华为MateBook Pro华为盘古推荐理由:华为MateBook Pro刚拿下国家级AI认证L3,说明它在智能辅助办公、学习上达到新标准,盘古和DeepSeek加持,值得关注。原文稍后读已读值得跟进有用关注 华为MateBook Pro
09:28官方一手pandaily@contact@pandaily.com (Pandaily)76°Moonshot AI将Kimi K3定价为每百万token 3-15美元,是此前K2.6价格的3-4倍。该定价为DeepSeek同类模型的3-15倍,成为当前中国最贵的大模型。此举标志着Moonshot AI从成本领先战略转向高价值复杂任务能力。国内计算生态系统的成熟为其提供支撑。AI模型Kimi K3Moonshot AIDeepSeek10 个信源在谈事件专题推荐理由:Moonshot AI出了个超贵模型Kimi K3,比DeepSeek贵3-15倍,但专攻复杂任务,不是打价格战。原文稍后读已读值得跟进有用关注 Kimi K3
03:40官方账号Decoder@Matthias Bastian73°Moonshot AI 发布 Kimi K3 模型,初步评估表现匹配 Anthropic 的 Opus 4.8。该模型由仅 300 人团队开发,OpenAI 战略师 Dean W. Ball 评价其“非常好”。Ball 同时警告开源权重模型主导将导致“AI 共产主义”,重新引发关于算力重要性及美国出口管制有效性的讨论。AI模型Kimi K3Moonshot AIAnthropic10 个信源在谈事件专题推荐理由:Kimi K3 用 300 人就追上 Anthropic 顶配,OpenAI 的人还吐槽开源是 AI 共产主义,值得看算力是否真的重要。原文稍后读已读值得跟进有用关注 Kimi K3
21:51Dify@dify_aiQubrid_AI在Dify Marketplace推出新插件,只需一个API key即可访问DeepSeek、Kimi、Qwen、MiniMax、GLM等多个模型。用户无需为每个模型单独配置API key和重构工作流,可直接在现有流程中切换模型。该插件解决了多模型切换时的集成痛点,提升了开发效率。技巧DifyQubrid_AIDeepSeek推荐理由:如果你在Dify上为不同模型来回换API key烦了,试试Qubrid_AI插件,一个key搞定DeepSeek、Kimi等多个模型,省事很多。原文稍后读已读值得跟进有用关注 Dify
17:01Geek@geekbb一条帖子讨论DeepSeek是否可能推出比Kimi K3性能更强且API价格控制在6元以下的模型。DeepSeek此前以低成本模型策略受到关注,Kimi K3是月之暗面最新发布的产品。该话题反映了社区对模型性价比的持续期待。行业DeepSeekKimi K3性价比10 个信源在谈事件专题推荐理由:社区在讨论DeepSeek能不能用低价做出比Kimi K3更强的模型,省流看热闹。原文稍后读已读值得跟进有用关注 DeepSeek
11:45官方一手pandaily@contact@pandaily.com (Pandaily)DeepRoute.ai在2026北京车展上宣布从ADAS供应商转型为Physical AI基础设施构建商。该公司将统一基础模型、大规模真实世界数据以及前DeepSeek科学家Ruan Chong的加入作为其核心战略,全力押注AI在物理世界的应用。行业DeepRoute.aiDeepSeekRuan Chong推荐理由:DeepRoute.ai拉来DeepSeek的Ruan Chong,从智能驾驶转向物理AI基建,看看他们要怎么做。原文稍后读已读值得跟进有用关注 DeepRoute.ai
11:22官方一手arXiv: DeepSeek@Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo该研究分析了GPT-4o mini、DeepSeek和Claude在460个编程任务(Python和Java各230个)上的代码生成质量,将英文提示翻译并人工校订为中文、印地语、西班牙语和意大利语。通过测试通过率、代码度量标准和静态分析工具评估,发现英文提示并非总能产生最佳功能正确性或代码质量,提示语言的影响取决于编程语言和LLM,且生成的代码常在注释和字符串中混合英语与提示语言。这是首个用于研究代码生成中语言偏差的精选多语言基准。论文GPT-4o miniDeepSeekClaude推荐理由:想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。原文稍后读已读值得跟进有用关注 GPT-4o mini
09:24orange.ai@oran_ge用户发推称实测了GLM 5.2和DeepSeek两个模型。GLM 5.2和DeepSeek在对话中均能生成中文内容。该测试未提供具体任务或基准分数。结果表明这两个模型的中文处理能力符合预期。AI模型GLM 5.2DeepSeek中文能力推荐理由:有人试了GLM 5.2和DeepSeek,都说中文没问题,想确认效果可以看看。原文稍后读已读值得跟进有用关注 GLM 5.2
01:45Suhail@Suhail用户整理了2025年4月16日至7月16日期间多个AI模型的发布日期,包括Opus 4.7(4/16)、Kimi K2.6(4/20)、GPT-5.5(4/23)、DeepSeek V4 Pro(4/24)、Opus 4.8(5/28)、Fable 5(6/9)、Kimi K2.7(6/12)、GLM-5.2(6/16)、Grok 4.5(7/8)、GPT-5.6(7/9)、Muse Spark 1.1(7/9)、Inkling(7/15)和Kimi K3(7/16)。该列表覆盖了来自Anthropic、月之暗面、OpenAI、DeepSeek、xAI、智谱等公司的13款模型。AI模型OpusKimiGPT10 个信源在谈事件专题推荐理由:想要快速回顾近四个月各家发了哪些模型?看这张时间表就够了,直接按时间排序,一目了然。原文稍后读已读值得跟进有用关注 Opus
22:44掘金本周最热@我是Allen作者停更一年,全力投入AI应用层工作,使用GitHub Copilot、智谱、Kimi、DeepSeek、ChatGPT、Claude Code等工具。陪伴妻子从怀孕到生娃,并尝试运营抖音和小红书母婴号。34岁在职考研,成功考上在职研究生项目。虽然没有深入框架层,但提升了业务理解和沟通能力。行业ChatGPTDeepSeekClaude Code推荐理由:一个程序员在AI浪潮、家庭和学业之间硬扛的真实故事,没有鸡汤,只有每天下班带娃再学习的细节。原文稍后读已读值得跟进有用关注 ChatGPT
15:16AI Will@FinanceYF5过去12个月,生成式AI网站流量份额出现显著变化。ChatGPT从76.4%降至52.7%,下降约24个百分点。Gemini从9.1%升至27.8%,成为第二大平台。Claude从1.6%升至9.2%,排名第三。DeepSeek从4.6%降至3.6%,Grok从3.3%降至2.5%。行业ChatGPTGeminiClaude推荐理由:看看12个月里ChatGPT掉到52%、Gemini涨到27%、Claude冲到9%,谁在吃掉对手的份额一目了然。原文稍后读已读值得跟进有用关注 ChatGPT
15:15AI Will@FinanceYF5Similarweb发布Gen AI网站流量份额更新。过去12个月,ChatGPT占比从76.4%降至52.7%。Gemini从9.1%升至27.8%,Claude从1.6%升至9.2%。DeepSeek从4.6%降至3.6%,Grok从3.3%降至2.5%。行业ChatGPTGeminiClaude推荐理由:Similarweb刚发了最新AI网站流量排名,ChatGPT份额掉得厉害,Gemini和Claude在猛涨,看看谁在蚕食市场。原文稍后读已读值得跟进有用关注 ChatGPT
11:32Ethan Mollick@emollickEthan Mollick评测新开源权重模型Inkling,指出其性能远不及DeepSeek R1等中国前沿开源模型。Inkling未能通过Lem测试,而该测试自DeepSeek R1/Sonnet 3.5以来已被所有前沿模型通过。Mollick认为Inkling目前还处于粗糙阶段。AI模型InklingDeepSeekLem测试10 个信源在谈事件专题推荐理由:想看看新开源模型Inkling到底行不行?Ethan Mollick实测发现它连Lem测试都过不了,和DeepSeek R1差距明显。原文稍后读已读值得跟进有用关注 Inkling
07:52IT之家(博客/媒体)OpenAI前CTO穆拉蒂创立的Thinking Machines Lab发布首款模型Inkling,参数达9750亿但仅410亿活跃,采用开放权重模式。其架构借鉴中国DeepSeek-V3,后训练使用月之暗面Kimi K2.5生成的数据。Thinking Machines称Inkling非最强模型,但追求成本与性能平衡,通过Tinker微调工具支持定制。安全测试显示表现良好,但开放权重内安全措施仍在完善。AI模型InklingThinking Machines LabDeepSeek10 个信源在谈事件专题推荐理由:穆拉蒂的新模型Inkling接近万亿参数但只激活一小部分,成本低速度快,还用了DeepSeek和Kimi的技术,适合做定制项目的人试试。原文稍后读已读值得跟进有用关注 Inkling
04:51Fireworks AI@FireworksAI_HQ根据@tryramp 2026年7月企业SaaS支出数据,AI支持机器人(如PolyAI、Sierra)成为最清晰的企业AI用例之一。开源模型(DeepSeek、Fireworks AI、Baseten、Together、OpenRouter)的使用量也在快速增长。Fireworks AI确认开源推理和训练需求旺盛,且@HiggsField_AI同时登上趋势榜和增长榜。这些趋势反映了企业对特定AI工具(如客服机器人)和开放模型的偏好。行业DeepSeekFireworks AI智能体推荐理由:Fireworks AI说开源模型需求火,AI客服机器人特别火,看看趋势榜都有谁。原文稍后读已读值得跟进有用关注 DeepSeek
09:41官方一手arXiv: DeepSeek@Wei Liu, Weisong Sun, Tingting Xu, Hanwei Qian, Yi Zhao, Chunrong Fang, Xia Feng本研究针对方法名预测(MNP)任务,发现现有评估多依赖token相似度指标(如BLEU)与人类判断不一致,且LLM直接代码-名称映射不及人类先理解再命名的过程。实验对比6种指标评估器、5种LLM评估器(包括DeepSeek)和6名人类评估者,显示DeepSeek评估器与人类判断更一致。进一步比较直接生成与摘要-精炼策略,后者提升了语义质量。基于此提出SMNP方法,融合MNP导向摘要和链式精炼,在5个LLM和2个数据集上验证了有效性。论文SMNPLLMMethod Name Prediction推荐理由:这篇论文告诉你:给代码自动取名时,先写摘要再命名比直接硬猜更靠谱。他们用DeepSeek做评估,效果比传统指标好十倍。原文稍后读已读值得跟进有用关注 SMNP
00:46官方账号Decoder@Jonathan Kemper72°中国AI实验室DeepSeek在刚关闭首轮70亿美元融资后仅几周又开始新一轮筹资。新资金将用于建设自有数据中心和芯片,以维持其激进的低价策略。此前DeepSeek通过大幅折扣API定价吸引用户,但高昂的算力成本迫使公司持续寻求外部资本。这反映出中国AI初创公司在扩张与盈利之间的资金压力。行业DeepSeek融资数据中心推荐理由:DeepSeek刚拿70亿美元又要钱,为了建自己的数据中心和芯片,维持低价策略,这说明烧钱战远没结束。原文稍后读已读值得跟进有用关注 DeepSeek
00:32AI Breakfast@AiBreakfastBloome 是一款跨平台 AI workspace 产品,支持人类与多个智能体在同一对话中协作:一个智能体起草、一个挑刺、一个润色终稿。它整合了 Claude、ChatGPT、DeepSeek 等不同模型,用户无需在标签页间切换。对话保持完整上下文,新加入的队友也能理解进展。Web、桌面和移动端均可使用,但桌面 app 体验更贴近真实团队协作。AI产品BloomeClaudeChatGPT推荐理由:如果你受够了在不同AI间切来切去,Bloome 让你把 Claude、ChatGPT、DeepSeek 都拉进一个对话,还能让智能体互相挑错改稿,桌面版用着真像团队开会。原文稍后读已读值得跟进有用关注 Bloome
00:09IT之家(博客/媒体)据彭博社报道,中国 AI 公司 DeepSeek 已开始筹备 IPO,计划在中国内地上市,最早于 2027 年完成。DeepSeek 正与会计师事务所和投行合作,目标在 2025 年底前完成财务报告。公司计划在 IPO 前进行新一轮私募融资,目标投前估值至少 4800 亿元人民币,拟融资至少 100 亿元。具体时间表可能根据市场环境和财报进度调整。行业DeepSeekIPO融资推荐理由:DeepSeek 要上市了!估值 4800 亿,融资至少 100 亿,AI 圈又一个大动作,想了解国内 AI 公司资本动向的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek
22:08量子位@一水DeepSeek-Coder-V2在SWE-bench Verified上以67.3%的成绩超越GPT-4o和Claude 3.5 Sonnet,成为首个免费开源的编码模型达到该水平。该模型在HumanEval上得分92.1%,在MBPP上得分90.5%。开发者可通过Hugging Face免费下载使用。AI模型DeepSeek-Coder-V2DeepSeek开源模型推荐理由:DeepSeek-Coder-V2免费开源,性能还超过了GPT-4o和Claude,写代码直接省钱了。原文稍后读已读值得跟进有用关注 DeepSeek-Coder-V2
20:05Junyang Lin@JustinLin610作者JustinLin610指出前沿模型效果好但成本高,个人订阅用户可最大化token使用量(如Codex月费200美元可产生超8000美元token消耗)。企业按token计费时,可将简单格式化任务分配给Seed、Qwen、DeepSeek等便宜模型,复杂智能体任务交给Fable、Sol。GLM 5.2编码能力接近Claude和GPT,Grok类似。合理设计系统能提升生产力且不增加成本。技巧ClaudeGPTDeepSeek推荐理由:如果你用AI时总担心费用,这篇聊透了怎么把便宜模型(如Qwen、DeepSeek)和贵模型(Claude、GPT)搭着用,省成本又出活。原文稍后读已读值得跟进有用关注 Claude
15:42Geek@geekbb精选CS Native 是一个面向 Claude Science 的本地 provider 和运行时控制面板,能在隔离沙箱中将模型请求转发到 DeepSeek、Qwen、OpenAI 等第三方供应商。它保留了官方 Claude Science 的独立入口,让用户可以在沙箱环境中安全地切换不同模型。该项目已在 GitHub 开源,可搭配 Claude Science 使用。技巧CS NativeClaude ScienceDeepSeek10 个信源在谈事件专题推荐理由:想给 Claude Science 换个模型后端?试试 CS Native,它让你在隔离沙箱里调用 DeepSeek、Qwen 或 OpenAI,还不丢官方入口。原文稍后读已读值得跟进有用关注 CS Native
11:30IT之家(博客/媒体)QuestMobile发布2026年6月AI应用市场报告,AI原生App月活达4.99亿,同比增长85.4%。豆包以3.82亿月活位居榜首,千问1.67亿、DeepSeek1.30亿紧随其后。豆包同比增长172.1%,千问同比增长5792.9%。用户黏性方面,豆包、DeepSeek、Kimi的10分钟以上用户占比分别为27.5%、30.0%、26.1%。AI原生App月人均用户时长达到183分钟,同比增长40%。行业QuestMobile豆包千问推荐理由:想看国内哪款AI应用用户最多?QuestMobile数据告诉你豆包月活3.8亿断层领先,千问增速近58倍,值得关注。原文稍后读已读值得跟进有用关注 QuestMobile
11:14官方一手arXiv: DeepSeek@Ilia KarpovMafiaScope是一个开源测试平台,将社交推理游戏“黑手党”转化为测量机器理论心智的工具。在32场DeepSeek案例研究中,它收集了13815个结构化探针回答,发现智能体的置信度校准误差为0.17,且高估自己被怀疑的概率达1.5倍。该平台支持交互式可视化、反事实重放,并已发布200+跨模型游戏语料库。论文MafiaScopeDeepSeek社交推理推荐理由:想研究LLM在社交推理中的真实信念?MafiaScope用探针实验和反事实回放,让你看到智能体表面的伪装。DeepSeek案例数据很硬核。原文稍后读已读值得跟进有用关注 MafiaScope
09:14官方一手arXiv: DeepSeek@Maxim Chupilkin一项论文使用背书实验测试GPT-5、Claude Sonnet、Gemini和DeepSeek四款大模型对国际经济与安全政策的评分。当政策被描述为获得美国或欧盟支持时,模型评分显著高于被描述为获得中国或俄罗斯支持的政策,数值条件中GPT-5、Claude Sonnet和Gemini对中国和俄罗斯背书的政策评分分别降低约10%-20%。加入要求模型提供理由后,GPT-5和Claude Sonnet的西方/非西方差距保持不变,Gemini的惩罚减弱,但DeepSeek此前无差距转而呈现对中国和俄罗斯的惩罚。模型理由显示西方背书被视为可信度信号,而中俄背书与数据安全、主权、监控或地缘政治风险关联。论文GPT-5Claude SonnetGemini推荐理由:这篇论文用实验数据告诉你,大模型评政策时会看谁站台——同一政策挂美国旗得分高,挂中国旗得分低。GPT-5、Claude Sonnet、Gemini、DeepSeek表现各异,值得关注。原文稍后读已读值得跟进有用关注 GPT-5
09:13官方一手arXiv: DeepSeek@Linhui Xiao, Guiping Cao, Mingyue Guo, Xianchao Guan, Fan Yang, Ming Tao, Xin Li, Yuxin Peng, Yaowei Wang该综述系统梳理了大型模型绿色发展的研究进展,涵盖注意力算子优化、线性复杂度架构、模型稀疏化与合并等效率型模型设计方法,以及数据高效学习、参数高效微调、计算压缩等训练与部署策略。在硬件层面,总结了主流AI芯片、内存优化、跨平台部署与可持续基础设施。还探讨了大型模型在DeepSeek、遥感解译、国家级基础设施等可持续关键领域的应用,并指出持续学习范式、以内存为中心的硬件和标准化评估协议等未来挑战。论文DeepSeek模型压缩绿色AI推荐理由:想了解怎么让大模型更省资源、更环保?这篇综述从算法优化到硬件设计都讲透了,还提到了DeepSeek等应用案例。原文稍后读已读值得跟进有用关注 DeepSeek
09:12官方一手arXiv: DeepSeek@Alexander Tian, Aditya Ghai, Sanjit Neelam, Zaal Vasania, Akshay Mishra精选COBS通过引入压缩的二阶统计量改进了DeepSeek Native Sparse Attention(NSA)的块选择策略。在32k RULER长上下文检索基准上,COBS将平均分从NSA基线的0.2999提升至0.8195,接近稠密注意力的0.9040,缩小了约86%的差距。其KV缓存读取流量仅为稠密注意力的1/15.15,比NSA基线高1.21倍。模型保持短上下文行为,并在位置负对数似然上低于稠密注意力。论文COBSNative Sparse AttentionDeepSeek推荐理由:COBS在NSA基础上加了个二阶统计量,长上下文检索分数从0.3拉到0.82,接近稠密注意力但省了十几倍带宽,很实用。原文稍后读已读值得跟进有用关注 COBS
20:37AI Will@FinanceYF5Ara Kharazian 指出外界可能高估了中国模型和开源模型对 OpenAI、Anthropic 收入的冲击。Ramp AI Index 显示 Anthropic 在企业市场持续扩大优势,42% 的企业在使用 Anthropic。OpenAI 的企业使用率基本持平。DeepSeek 的企业使用率仅为 0.3%。行业Ara KharazianAnthropicOpenAI10 个信源在谈事件专题推荐理由:分析师 Ara Kharazian 用 Ramp AI Index 数据告诉你:Anthropic 企业份额达 42%,DeepSeek 只有 0.3%,别高估开源模型的威胁。原文稍后读已读值得跟进有用关注 Ara Kharazian
10:53官方一手Pandaily@contact@pandaily.com (Pandaily)精选DeepSeek、智谱AI和Qwen的成本高效模型在OpenRouter平台上周令牌份额超过20%,数据基于2025年7月的统计。这一增长显示开发者正从高价模型转向性价比更高的选项。结构性的市场转变表明成本正在成为AI基础设施选择的关键因素。行业DeepSeekZhipuQwen推荐理由:开发者的钱袋更聪明了:DeepSeek、智谱、Qwen靠低价拿下OpenRouter五分之一流量,值得关注。原文稍后读已读值得跟进有用关注 DeepSeek
10:48官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek和智谱AI据报道正在开发自研AI推理芯片,效仿OpenAI和Anthropic此前路线。两家公司希望通过自研芯片降低推理成本并提升效率,目前具体规格和发布时间尚未披露。此举表明中国头部AI公司正加速向上游硬件延伸。行业DeepSeekZhipu AIAI芯片10 个信源在谈事件专题推荐理由:DeepSeek和智谱也要自研AI芯片了,和OpenAI同赛道,看看他们能不能控制推理成本。原文稍后读已读值得跟进有用关注 DeepSeek
10:19官方一手Pandaily@contact@pandaily.com (Pandaily)智谱AI和DeepSeek的中国AI模型在美国开发者中份额增长,其成本性能优势达到美国同行的10倍。这一性价比差距吸引了大量开发者从OpenAI等转向使用中国模型。例如DeepSeek-V2的API价格仅为GPT-4的1/10,而智谱AI的GLM-4在多项基准上接近美国顶级模型。行业Zhipu AIDeepSeek性价比10 个信源在谈事件专题推荐理由:智谱AI和DeepSeek的模型成本只有美国同行的十分之一,性能还不差,开发者快去试试。原文稍后读已读值得跟进有用关注 Zhipu AI
15:06@koltregaskes@koltregaskes83°OpenAI于今日向公众全面发布GPT-5.6,此前仅对合作伙伴开放,并应美国政府要求延迟上市。GPT-6预计约一个月后发布,基于全新预训练基础而非Spud架构。谷歌Gemini 3.5 Pro仍在内测中,目标提升推理深度和智能体性能,计划7月发布。MiniMax正准备2.7T参数模型M3 Pro,DeepSeek筹备V4 GA,中国当局讨论限制先进模型海外访问。AI模型GPT-5.6Gemini 3.5 ProMiniMax10 个信源在谈事件专题推荐理由:各家疯狂出新模型,OpenAI今天正式发GPT-5.6,谷歌的Gemini 3.5 Pro快了,中国也有新动作,竞争太激烈了。原文稍后读已读值得跟进有用关注 GPT-5.6
10:42宝玉@dotey79°据爆料,OpenAI准备跳过5.x系列,直接发布GPT-6,可能一个月内到来,作为对Anthropic Mythos 5的回应。GPT-5.6(代号Spud,约4T token)将于7月9日向公众开放,但GPT-6将使用全新的更大预训练底座。Anthropic的Mythos 5因网络安全能力导致美国出口管制,禁令于6月30日解除,Fable 5.1预计几周内发布。xAI正在训练10T参数的Grok,DeepSeek V4正式版7月中旬上线,能力可能追平GLM-5.2,同时MiniMax M3 Pro(2.7T参数)计划Q3开源。行业GPT-6GPT-5.6Anthropic10 个信源在谈事件专题推荐理由:想了解OpenAI、Anthropic、xAI和国产模型的最新动静?这篇爆料把GPT-6的加速发布、Mythos引发的连锁反应都串起来了,还提到DeepSeek V4和GLM-5.2的竞争,信息量很大。原文稍后读已读值得跟进有用关注 GPT-6
10:20官方一手arXiv: DeepSeek@Lifei Liu, Haoran Yu, Xiaochong Jiang, Su Wang, Pin Qian, Yihang Chen这项研究提出一种五条件对比设计,拆解多智能体LLM安全中的三个机制。在30个合成有害场景和四个安全基准上测试,发现操作重构是最可迁移的风险信号,使GPT、Gemini和DeepSeek的合规性上升,而Claude相对抵抗。批准框架委托的敏感性因提示设计、模型配对和场景来源而异,怀疑性执行提示可大幅降低合规性。原始直接模型排名可能误导:Gemini在直接提示中最安全(8.9%),但与Claude规划器配对后合规性升至38.9%。GPT的零净管道效应实际上隐藏了重构增加被规划器拒绝抵消的事实。论文GPTGeminiDeepSeek推荐理由:这篇论文拆穿了多智能体安全评估的常见错觉——GPT看似安全但只是被拒绝掩盖,Gemini配对Claude反而危险。做安全测试时别只看总数。原文稍后读已读值得跟进有用关注 GPT
17:16量子位@听雨翁荔在最新博客中提出AI自进化应首先构建Harness框架。DeepSeek成员崔添翼转发该博客并评论称该方向容易出成果。Harness可能作为系统化工具简化自进化流程,引发行业关注。AI模型翁荔HarnessDeepSeek推荐理由:翁荔给自进化指了条新路:先搭Harness。DeepSeek的崔添翼都说容易出成果,搞自进化的可以看看。原文稍后读已读值得跟进有用关注 翁荔
16:08官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek与智谱AI宣布自研AI推理芯片,效仿OpenAI和Anthropic。此举旨在降低对英伟达GPU的依赖,并削减推理成本。国内头部AI实验室开始从模型层面向上游芯片延伸,标志行业结构转型。行业DeepSeek智谱AI自研芯片10 个信源在谈事件专题推荐理由:DeepSeek和智谱也开始自己造芯片了,目标就是省钱和摆脱对英伟达的依赖。原文稍后读已读值得跟进有用关注 DeepSeek
14:48IT之家(博客/媒体)CNBC报道,全球AI聚合平台OpenRouter数据显示,自2月8日以来,美国公司每周调用DeepSeek、智谱GLM系列等中国模型的比重持续超过30%,峰值达46%。过去12个月平均比例仅为11%,而2025上半年最低点仅4.5%。AI初创公司Lindy在6月将全部流量从Anthropic的Claude切换至DeepSeek,CEO称数月节省数百万美元。OpenRouter指出,中国开源模型价格较Anthropic和OpenAI领先模型低60%至90%。性能差距缩小:GLM 5.2在Agent基准上分数与Anthropic Opus 4.8仅差1个百分点,成本约为后者的1/5。行业DeepSeekClaudeOpenRouter10 个信源在谈事件专题推荐理由:DeepSeek比Claude便宜九成,性能差距不到十个月,美国企业批量迁移,OpenRouter数据硬核实锤,省钱看这篇。原文稍后读已读值得跟进有用关注 DeepSeek
14:10量子位@梦晨DeepSeek于一年前启动秘密造芯项目,专攻AI推理芯片。目前已与多家芯片设计公司、晶圆代工厂和存储器供应商展开接洽。招聘全程不公开,显示该项目高度保密。此举可能降低对第三方芯片的依赖,提升推理效率。行业DeepSeekAI芯片推理芯片推荐理由:DeepSeek偷偷造芯片了,专为推理优化,已经找好代工厂和存储器供应商,硬件布局动了真格。原文稍后读已读值得跟进有用关注 DeepSeek
11:31官方一手arXiv: DeepSeek@Andrew Zhang, Chengzhan Li论文提出 Agent Step Value (ASV) 框架,通过重放黑盒轨迹并用无状态 LLM 评估器打分,量化每一步的价值。在 100 道开放问答任务(使用 PubMed 实时检索和 DeepSeek 对数概率评分)上,ASV 评估了 1,100 次转移,结果显示熵移动为 0.000,平均贝叶斯惊讶为 2.693,表明信念近乎 one-hot 转折。在 128 个 token 的 rationale 条件下,平均黄金边际增益为 -2.335(95% CI [-3.395, -1.272]);而直接用单 token 评分同一轨迹得到 +4.033。论文通过 100 次转移的组件审计追踪到反转源于短 rationale 对完整状态的覆盖。论文ASVAgent Step ValueDeepSeek推荐理由:这篇论文教你怎么用 ASV 框架来拆解 AI agent 每一步的决策价值,在开放问答任务上实测发现短 rationale 反而有害,做 agent 评估的必看。原文稍后读已读值得跟进有用关注 ASV