7月31日
15:45
15:45官方一手歸藏(guizang.ai)@op7418
72°
DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。
事件专题

推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。
15:40
15:40官方账号深度求索 DeepSeek@deepseek_ai
DeepSeek-V4-Flash 官方 API 现已进入公开测试版,Agent 能力获得升级。官方基准成绩显示其已远超 V4-Pro-Preview。该 API 原生支持 Responses API 格式,并已完全适配 Codex。具体配置方法见官方文档 api-docs.deepseek.com/quick_start/ag...
事件专题

推荐理由:DeepSeek把V4-Flash的API开放公测了,Agent能力比V4-Pro-Preview强不少,还直接适配Codex,想试新模型可以去看看。
15:23
7月30日
7月29日
12:27
12:27官方一手歸藏(guizang.ai)@op7418
精选
Codepilot 推出了 Subagent 功能,允许用户在一个聊天中启用多个由不同模型驱动的子智能体。例如可用 Grok 检索 Twitter 信息、DeepSeek 生成文案、K3 生成网页、GLM 5.2 统筹。该设计旨在发挥各模型长处,同时减少昂贵模型的消耗,降低使用成本。

推荐理由:Codepilot 这个 Subagent 功能真香,一个聊天里混用 Grok、DeepSeek、GLM 5.2 等模型,各取所长还省钱,试试看。
12:26
12:26官方一手歸藏(guizang.ai)@op7418
作者使用 Codepilot 的一条提示词,让 Grok 爬取 Twitter 信息、Kimi 生成网页、DeepSeek 撰写文案,并由 GLM 5.2 统筹。该 workflow 成功完成昨天 AI 热点事件统计,时效性与人工搜集相当,甚至补充了漏掉的信息。通过分模型调用,降低了昂贵模型的消耗。

推荐理由:想用最少的成本让不同模型干各自擅长的事?参考这个 workflow:Grok 爬推文、DeepSeek 写文案、Kimi 做网页、GLM 5.2 调度。
12:25
12:25官方一手歸藏(guizang.ai)@op7418
用户通过一句提示词,调用 Grok 进行 Twitter 热点事件信息爬取,Kimi 生成网页,DeepSeek 撰写文案。三个模型分工协作,完成了昨日 AI 热点事件的统计,结果与手动搜集高度一致,并补充了遗漏信息。展示了多模型组合工作流的实际效果。
推荐理由:用一句提示词让 Grok、Kimi、DeepSeek 各司其职,自动统计 Twitter 热点,省时又全面,适合想提升信息搜集效率的人。
11:23
11:23官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou
该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。
推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。
7月28日
16:16
16:16官方一手Pandaily@contact@pandaily.com (Pandaily)
82°
Moonshot AI发布47页Kimi K3技术报告,核心架构包括KDA+Gated MLA混合注意力机制。AttnRes跨层检索层降低推理成本。Stable LatentMoE包含896个专家,支持动态路由。采用51.2M规模的RL沙箱进行强化学习训练,提升模型对齐能力。报告还引入模型参数与推理时间两个缩放轴,重新定义性能前沿。
事件专题

推荐理由:Moonshot AI 发了Kimi K3的47页技术报告,混合注意力、896专家MoE和5100万RL沙箱的架构特别硬核,值得看它怎么跟DeepSeek对标。
12:03
12:03官方一手arXiv: DeepSeek@Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic
76°
该研究对GPT-5、Claude、Grok、Gemini、DeepSeek、Kimi、Qwen共7个主流模型进行了基于政治轴的可控性压力测试,使用12种意识形态角色提示和70个政治指南针项目,共收集63,700条回答。结果发现,上下文框架解释了经济和社会轴上约88%-93%的方差,而模型自身身份的影响不到3%。在威权提示下,不同模型在相同问题上表现出相似偏移。研究强调需要进行可操控性审计,报告分散性、对称性、饱和度和拒绝底线。数据集和代码已开源。
推荐理由:这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
7月27日
10:57
10:57官方一手arXiv: DeepSeek@Deyu Yang, Rundong Wei, Xiaoqi Li
该论文提出一种结合漏洞聚焦代码切片、ERC-721 知识库和约束 DeepSeek 的 NFT 智能合约漏洞检测方法。在 450 个 NFT 合约样本上,完整配置的检测器给出了 437 个正标签,正标签率达到 97.1%。去除外部知识库后,正标签率降至 87.11%;进一步去除代码切片,正标签率降至 73.78%。结果表明,聚焦代码上下文和领域约束显著影响检测效果。
推荐理由:研究了一套专门针对 NFT 合约的漏洞检测方法,用 DeepSeek 加代码切片把准确率干到了 97.1%,比纯分析完整合约高了 23 个百分点。做合约安全的可以看看。
7月24日
16:54
16:34
16:34官方账号阿里云 Alibaba Cloud@alibaba_cloud
精选
阿里云发布Token Plan,用一个信用池整合Qwen、Wan、HappyHorse、DeepSeek和GLM等模型的使用费。用户只需为实际调用的token付费,无需管理多个订阅。该计划旨在简化AI工具成本管控,适用于企业和开发者。

推荐理由:阿里云搞了个Token Plan,把Qwen、Wan这些模型的花费统一到一个池子里,按实际用量扣钱,省去多个订阅的麻烦。
09:21
09:21官方一手arXiv: DeepSeek@Paolo Modesti, Syed Ahmed, Ioannis Sfyrakis, Derek Enodolomwanyi
一篇论文评估了GPT和DeepSeek在符号安全协议分析中的能力,使用130个混淆的AnB/AnBx协议涵盖388个安全目标,与ProVerif和OFMC工具对比。Chat模式召回率69%-81%,但精确率低于31%。推理模式将GPT精确率提升至66.5%,DeepSeek至45.4%,但仅检测到一半以上攻击。在保密性目标上,推理模式F1达到95.7%。各模型在认证目标上表现最差,且判断不稳定。
推荐理由:这篇论文用具体数据告诉你,GPT和DeepSeek在形式化验证上还比不上ProVerif这些专业工具,但推理模式能把精确率拉到66%,可能当个预筛选过滤器。
7月23日
00:24
00:24官方一手歸藏(guizang.ai)@op7418
精选
Codepilot即将发布新版本,允许用户为每个SubAgent单独指定模型。例如,可用Grok检索Twitter内容,用DeepSeek生成文案,用Kimi K3生成网页。该功能让不同模型发挥各自特长,提升协作效率。
事件专题

推荐理由:以后一个任务里可以让Grok搜推、DeepSeek写稿、Kimi做页面,想怎么混搭都行。
7月22日
11:24
11:24官方一手arXiv: DeepSeek@Yin Wu, Yixuan Liu, Yi Li, Chenyang Peng, Hao Wu, Ming Fan, Ting Liu, Haijun Wang
论文系统化分析了ERC-20代币合约中隐蔽陷阱的分类,提出基于代币功能生命周期的分类法。TrapHunter框架结合抽象行为树(ABT)与增强路径图(APG)统一语义表示,利用LLM推理行为意图偏差,并通过分叉动态验证确认可攻击性。在269份真实合约上使用DeepSeek、GPT和Gemini三种LLM进行测试,平均精确率81.8%,召回率85.4%,显著优于现有工具。
推荐理由:想防智能合约陷阱?这篇论文把隐蔽代币合约的六类套路全解剖了,用三种大模型验证,精确率81.8%,比现有工具强一截。
11:22
11:22官方一手arXiv: DeepSeek@Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler
这篇论文通过两个案例研究分析了Claude和DeepSeek的四代模型在SWE-bench Lite上的非功能性质量差异。静态分析显示大多数CodeQL配对差异为零,且无CodeScene比较在Holm校正后显著。CPU时间差异较小且不一致,峰值内存略高但绝对差异很小。整体上,较晚模型解决更多实例,但在共同解决的任务中非功能性指标无一致改进。
推荐理由:这篇研究不只看模型能修复多少问题,还比较了Claude和DeepSeek不同代际的代码质量、CPU时间和内存使用,发现新模型虽修得多但代码质量没明显提升。
7月21日