6月27日
16:27
16:27官方一手Pandaily@contact@pandaily.com (Pandaily)
DeepSeek放弃了“不融资、不商业化”的立场,获得创纪录的70亿美元融资。该公司计划将所有部门的规模扩大一倍。同时推出Harness AI编码代理团队,与Anthropic的Claude Code直接竞争。
事件专题

推荐理由:DeepSeek拿了70亿美金扩招一倍,新出的Harness AI编程工具对标Claude Code,AI竞争又升级了。
6月26日
23:30
23:30官方账号Decoder@Matthias Bastian
AI初创公司Lindy因AI成本超过人员成本,完全放弃Anthropic的Claude模型,转而采用DeepSeek。CEO Flo Crivello称此举是“为了企业生存”。这一变更预计每年节省数百万美元。事件反映了AI模型成本压力对初创公司决策的直接影响。
事件专题

推荐理由:Lindy为了省钱,把Claude全换成了DeepSeek,省了几百万美元。这家公司说再不用DeepSeek就活不下去了——模型价格战就是这么现实。
09:59
09:59官方一手pandaily@contact@pandaily.com (Pandaily)
DeepSeek 近期从工程效能平台 Harness 积极招募工程师,同时计划自建计算基础设施。此举标志其 AI 战略从依赖外部算力转向自建重型模式。公司旨在通过自主算力降低成本并提升效率。

推荐理由:DeepSeek 不满足于租别人的算力,开始自己建了。他们正猛挖 Harness 的工程师,从轻模式转向重资产,这可能会改变行业格局。
6月23日
6月22日
6月18日
09:21
09:21官方一手arXiv: DeepSeek@Yifu Ding, Jiacheng Wang, Ge Yang, Yongcheng Jing, Jinyang Guo, Xianglong Liu, Dacheng Tao
精选
该论文针对混合专家(MoE)模型部署时内存和推理开销大的问题,提出一种结构剪枝框架。方法将剪枝比率分配转化为通道分数覆盖最大化问题,通过归因近似高效求解。在DeepSeek和Qwen MoE模型上实验,结合4-bit量化后,50%或25%结构化剪枝仍保持模型准确率。在Qwen3-30B-A3B上,内存占用减少5.27倍,优于现有基线。
推荐理由:想省显存又怕掉精度?这篇论文用通道级剪枝加4-bit量化,把MoE模型体积砍到1/5还能保住性能,DeepSeek和Qwen都能用。
00:35
00:35Geek@geekbb
从2022年期待本地运行ChatGPT-3.5,到2026年DeepSeek、Qwen、GLM、Kimi每月发布旗舰模型。本地部署模型列表包括GLM-4、DeepSeek R1/V3、Qwen3、Kimi-K2、GPT-oss-120b、Qwen3.7-Plus、Kimi-K2.7、Deepseek-V4、GLM-5.2等九个版本。迭代速度远超预期,社区感叹没有尽头。
推荐理由:这帖子把2022到2026国产模型进化史盘得清清楚楚,DeepSeek、Qwen、GLM、Kimi每月一个旗舰,本地部署清单都快十个版本了,AI发烧友必看。
6月17日
09:55
09:31
09:31官方一手arXiv: DeepSeek@Esteban Schafir, Xu Zheng, Hojat Allah Salehi, Zhuomin Chen, Mo Sha, Wei Cheng, Dongsheng Luo
精选
DecoSearch是一个无需训练的Text-to-SQL框架,通过轻量级Schema Selector修剪数据库模式,LLM Judger判断查询是否需要分解为DAG子问题。在BIRD上达到70.53%执行准确率,在Spider上达88.31%,使用DeepSeek作为骨干模型,比训练无关基线消耗少一个数量级的token。该方法还可作为模型无关包装器,一致提升微调后的SQL生成骨干性能。
推荐理由:DecoSearch不用训练就能把自然语言转SQL,在BIRD和Spider上准确率分别超70%和88%,比同类方法省十倍token。想提升SQL生成效率可以看看。
09:31
09:31官方一手arXiv: DeepSeek@Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang
该论文提出了LLM代码推理的内部生命周期概念:模型先在早期层中酝酿答案,使其线性可解,然后在后期层分化为四种解析结果——已解析、过度处理、错误解析、未解析。研究对Qwen、Llama、DeepSeek三个架构的16个模型进行了6类代码推理任务的层析探针和上下文剥离解码(CSD)实验。结果显示已解析平均仅41.5%,且函数调用任务中,调用深度从1层增至3层时已解析率从61.1%骤降至2.5%。所有模型的酝酿持续时长稳定在24%-42%,但解析成功率随模型能力和规模变化。
推荐理由:这篇论文用层析探针找到了LLM做代码推理时“酝酿”到“解析”的秘密,发现即便准确率相近,内部失败模式也截然不同,值得想理解推理本质的人读。
03:38
6月16日
18:28
18:28官方账号Decoder@Jonathan Kemper
73°
中国AI初创公司DeepSeek在首次外部融资轮中筹集超过50亿人民币(约7.4亿美元),公司估值达到500亿美元。这是DeepSeek首次接受外部投资,此前主要依赖内部资金。该轮融资由多家机构参与,显示出市场对DeepSeek技术实力的认可。

推荐理由:DeepSeek第一次拿外部钱,融了74亿美元,估值冲到500亿,看看这家中国AI新势力怎么做到。
10:47
10:47官方一手arXiv: DeepSeek@Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan
论文在Qwen2.5、LLaMA-3和DeepSeek三个系列上发现:用小模型自身生成并通过拒绝采样选取的轨迹,比用更强Oracle模型精炼的高奖励数据,能更有效提升数学推理。Oracle精炼虽修复逻辑,但引入分布偏移,增加小模型适应成本,抵消了逻辑改进的收益。作者提出风格对齐精炼(Style-Aligned Refinement),保留小模型原生轨迹风格同时融入Oracle逻辑修复,降低适应成本并恢复下游效用。该发现挑战了数学推理蒸馏中依赖奖励模型分数选择数据的常规做法。
推荐理由:这篇论文揭穿了一个直觉错误:你以为给小白模型喂“学霸笔记”能变强,结果效果还不如它自己瞎写的解题草稿。原因是学霸的思路和它不匹配,硬学反而费劲。