9月3日
11:49
11:49官方一手arXiv: DeepSeek@Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu
精选73°
该研究提出了一种行为融合模型,结合大语言模型和本体排序器进行罕见病诊断。在Phenopacket Store和RAMEDIS数据集上,融合方法将Phenomizer Recall@1分别提升7.86和20.18个百分点。当与DeepSeek-V4-Flash API结合时,融合模型将Recall@1从0.1657提升至0.2176,提升5.19个百分点,无需重新训练。90.8%的正确融合诊断保留了可检查的本体证据。
事件专题

推荐理由:研究将LLM与本体排序器融合,提升罕见病诊断准确率,同时保留可追溯的证据链。
8月31日
16:07
16:07官方一手Pandaily@contact@pandaily.com (Pandaily)
精选73°
StartLux的270亿参数本地模型在CAICT MCP测试中排名第二,性能超过DeepSeek-V4-Flash。该模型达到了万亿参数级别的能力表现。CAICT MCP测试是中国AI领域的重要基准。
事件专题

推荐理由:StartLux发布了27B本地模型,在中国基准测试中击败了DeepSeek V4 Flash,性能接近万亿参数级别。
8月26日
23:10
23:10官方账号Decoder@Matthias Bastian
精选73°
阿里巴巴Qwen团队发布Qwen3.8-Flash-Next,混合专家模型,每token激活125亿参数中的6个。训练成本降低至九分之一,在编码和办公基准测试中击败DeepSeek-V4-Flash和Claude Opus 4.6,对OpenAI和Anthropic构成更多价格压力。
事件专题

推荐理由:想了解阿里巴巴如何以更低成本打造强大模型?Qwen3.8-Flash-Next值得一试,它比DeepSeek-V4-Flash和Claude Opus 4.6更高效,成本更低。
8月25日
10:24
10:24官方一手arXiv: DeepSeek@Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang
提出ISAC框架,结合代码差异和问题信息生成提交信息,ApacheCM-Issue数据集支持评估,GPT-5.5和DeepSeek-V4-Flash模型测试,问题信息提升模型性能,结构化问题摘要改善感知完整性,但可能牺牲上下文细节。
事件专题

推荐理由:研究ISAC框架,了解如何利用问题信息提升LLM生成提交信息的效果,与现有方法相比有显著提升。
8月10日
16:27
16:27官方一手pandaily@contact@pandaily.com (Pandaily)
OpenRouter数据显示,中国大模型周Token使用量首次突破34.25万亿,前四名均为中国模型。DeepSeek-V4-Flash正式上线后以环比增长570%的成绩跃居榜单第一。中国模型已连续15周保持全球Token使用量领先。
事件专题

推荐理由:中国模型又赢了,DeepSeek-V4-Flash刚发布就冲到全球第一,周涨570%,去看看吧。
8月5日
8月4日
23:40
23:40lmarena.ai@lmarena_ai
精选
LMArena 公布 DeepSeek-V4-Flash-20260731(High) 的五项关键信号。总体得分上升 1.98%,确认成功项提升 6.99%,好评对差评比增加 1.54%。可引导性下降 2.31%,Bash 恢复得分 2.53%,工具幻觉率 1.2%。数据来自竞技场真实用户反馈。
事件专题

推荐理由:想知道 DeepSeek 最新版行不行?看这五个真实用户信号,总体涨近2%,确认成功涨7%,但可引导性跌了。
8月1日
7月31日
17:41
17:41向阳乔木@vista8
精选
DeepSeek-V4-Flash的官方API已进入公开测试。其Agent能力基准分数远超V4-Pro-Preview。该版本原生支持Responses API格式。同时完全适配Codex,开发者可在DeepSeek官方文档查看配置详情。
事件专题

推荐理由:DeepSeek把V4-Flash的API放出来了,Agent能力比V4-Pro-Preview还猛,而且直接支持Codex,开发者快去试试。
16:47
16:47官方账号深度求索 DeepSeek@deepseek_ai
DeepSeek-V4-Flash-0731与预览版保持相同的模型架构和大小。本次升级只作用于DeepSeek-V4-Flash API,DeepSeek-V4-Pro API和App/Web端模型均未变化。DeepSeek官方表示,DeepSeek-V4-Pro正式版将尽快发布。
事件专题

推荐理由:DeepSeek刚更新了V4-Flash API到0731版,但架构和预览版一样,V4-Pro正式版马上就出,API开发者可以先升级试试。
15:45
15:45官方一手歸藏(guizang.ai)@op7418
72°
DeepSeek 官方发布 DeepSeek-V4-Flash 的官方 API,已进入公开测试阶段。该版本重点强化 Agent 能力,官方宣称其基准得分已远远超过 V4-Pro-Preview。V4-Flash 原生支持 Responses API 格式,并已完全适配 Codex 客户端。具体配置方式见 DeepSeek 官方 API 文档。
事件专题

推荐理由:DeepSeek 把 V4-Flash API 放出来公测了,Agent 能力比 V4-Pro-Preview 强不少,还直接支持 Codex,想玩可以去翻官方文档。
7月14日
09:59
09:59官方账号arXiv cs.AI@Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li
SETA是一个可扩展框架,用于生成可验证的终端环境以支持强化学习。其构建的SETA-Env数据集包含超过4500个环境,是当前最大的开源可验证终端RL数据集。使用Qwen3-8B在SETA-Env上训练,在Terminal-Bench 2.0上达到12% pass rate,为8B规模RL训练模型的最佳结果。在DeepSeek-V4-Flash上,同一终端代理基准的pass@1从40%提升至43%,pass@5从54%提升至58%。SETA-Env为终端代理研究提供了高质量的训练环境。
推荐理由:终端代理训练数据难找,SETA开源了4500+环境的RL数据集,Qwen3-8B训后Terminal-Bench拿到12%,顺带还让DeepSeek-V4涨了分,搞终端AI的别错过。
7月3日
16:26
16:26官方一手pandaily@contact@pandaily.com (Pandaily)
蚂蚁集团与香港科技大学(广州)联合提出Skill-MAS框架,该框架将多智能体系统设计经验抽象为可重用的元技能。在DeepSeek-V4-Flash等模型上的实验验证了其有效性,能够通过元技能进化机制提升多智能体协作效率,并实现跨场景迁移。此外,Skill-MAS支持动态组合元技能以适应不同任务需求。
事件专题

推荐理由:蚂蚁和港科大的新框架Skill-MAS,把多智能体经验打包成可复用的元技能,在DeepSeek-V4-Flash上验证有效,做多智能体开发可以看看。