9月3日
12:05
12:05官方一手arXiv: DeepSeek@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang
精选73°
PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化独立矩阵误差转变为保留专家输出误差。在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型的精度差距分别缩小1.41倍和1.44倍,同时实现相同的峰值内存减少。
推荐理由:PARSER方法通过输出重要性指标优化MoE模型压缩,在相同内存减少下提升模型精度。
9月2日
16:13
09:32
09:32官方一手arXiv: DeepSeek@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang
精选73°
PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化孤立矩阵误差转变为保留专家输出误差。实验显示,在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型之间的精度差距分别缩小1.41倍和1.44倍,同时实现了相同的峰值内存减少。
推荐理由:PARSER方法解决了MoE模型压缩中误差累积问题,在相同内存减少下提升模型精度。
9月1日
10:34
10:34官方一手Pandaily@contact@pandaily.com (Pandaily)
DeepSeek在Hugging Face上发布了V4-Flash-Vision-Exp,采用MIT许可证。这是V4系列首次支持图像输入的原生视觉模型。该模型扩展了DeepSeek的产品线,为多模态应用提供了新选择。

推荐理由:DeepSeek开源了首个原生视觉模型V4-Flash-Vision-Exp,支持图像输入,MIT许可证可商用。
8月31日
21:47
21:47shao__meng@shao__meng
73°
DeepSeek-V4-Flash-Vision-Exp 模型已开源,总参数量达 305B。该模型在 DeepSeek-V4-Flash 架构上增加视觉编码器和 aligner,获得视觉理解能力。每张图片最多按 384 tokens 计费,多模态性能接近 Claude Opus-4.8。
事件专题

推荐理由:DeepSeek 10 天前发布 API,10 天后就开源了这款 305B 参数的多模态模型,性价比超高。
8月28日
23:22
17:19
17:19官方一手arXiv: DeepSeek@Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang
精选73°
研究人员通过两个经济游戏和认知计算模型,测试了DeepSeek、GPT-4.1、GPT-5和Gemini 2.0 Flash共2099个LLM代理的心智化能力。结果显示,不同模型提供商和大小的LLM表现出明显不同的心智化行为和计算特征。GPT-5代理能够灵活调整其递归推理深度,表现优于251名人类参与者。
推荐理由:这篇论文用经济游戏测试了四大模型家族的心智化能力,发现GPT-5能灵活调整推理深度,表现超过人类。
8月27日
09:19
09:19官方一手arXiv: DeepSeek@Xiao Fan, Jingyuan Li, Hongbin Guo, Yubo Han, Yi Zhang
This paper proposes claim-locked reporting, a protocol that ensures the statistical evidence in scientific reports is fixed by structured results before prose generation. It improves reproducibility by 37.4 and 20.5 points in fMRI and randomized controlled trial reporting, respectively. DeepSeek's fMRI cost analysis demonstrates lower token use and generation latency with this method.
推荐理由:This paper introduces a new reporting protocol for scientific reports that could significantly improve reproducibility. It's a must-read for anyone interested in improving the quality of scientific reporting and the use of LLMs in research.
8月26日
16:06
09:55
8月25日
20:10
12:48
12:48IT之家博客/媒体
72°
中国AI模型快速缩小与美差距,清华大学等高校人才网络、开源技术、人才回流和高效算力共同推动。智谱AI、月之暗面、DeepSeek等研究者构成重要力量。中美AI模型能力差距已缩小至数月。
事件专题

推荐理由:想了解中国AI发展,看这些关键人物如何推动技术进步。智谱AI、月之暗面、DeepSeek,技术交流与人才回流加速追赶。
10:28
10:28官方一手arXiv: DeepSeek@Donghui Zha, Lingwei Xu, Linxiao Wu, Yixue Dong, Haochen Li
本文提出CacheRouter,一种双路径路由设计,将工具选择和交付分配到不同的通道。主模型始终看到一组固定的核心工具,其他工具通过独立的路由通道选择和执行。工具注册自动化,支持运行时更新。在55个功能查询和30轮对话中测试,缓存命中率达到90.99%和95.2%,在DeepSeek定价下,缓存命中输入令牌成本约为缓存未命中令牌的1/30。
推荐理由:CacheRouter通过双路径设计优化了LLM系统中的工具使用,自动化工具注册和运行时更新,显著提高缓存命中率,降低输入成本,值得一试。
10:20
04:36
01:38
8月23日
16:14
07:48
07:48IT之家博客/媒体
特斯拉监督版FSD不支持中国;DeepSeek调整API计费,周末统一低谷价;成都铁路局回应占座放零食事件;雷军携小米折叠新机现身;Anthropic计划IPO,目标估值2万亿;OPPO暂停小屏手机项目;苹果上架Bellroy邮差包;iPhone 18 Pro手机壳曝光;世界人形机器人运动会开幕;微软Win11默认启用时光机;印度少年为iPhone威胁父母跳崖身亡;小米首款RGB-Mini LED电视开启盲订;雷军川渝续航挑战第一;豆包输入法鸿蒙版尝鲜;宝马新世代i3续航超1000公里;小米miclaw结束封测;特斯拉回应召回;漫威《复仇者联盟4》重映;小米调研洗鞋机;荣耀机器人破百米记录;OpenAI下调GPT-5.6 Sol模型价格。
事件专题

推荐理由:特斯拉FSD不支持中国,DeepSeek周末统一低谷价,成都铁路局回应占座事件,雷军携小米折叠新机,Anthropic计划IPO,OPPO暂停小屏手机项目,苹果上架Bellroy邮差包,iPhone 18 Pro手机壳曝光,世界人形机器人运动会开幕,微软Win11默认启用时光机,印度少年为iPhone威胁父母跳崖身亡,小米首款RGB-Mini LED电视开启盲订,雷军川渝续航挑战第一,豆包输入法鸿蒙版尝鲜,宝马新世代i3续航超1000公里,小米miclaw结束封测,特斯拉回应召回,漫威《复仇者联盟4》重映,小米调研洗鞋机,荣耀机器人破百米记录,OpenAI下调GPT-5.6 Sol模型价格。这些资讯都是最新的,值得关注。
05:03
8月22日
22:33
20:58
20:58IT之家博客/媒体
DeepSeek 将于 2026 年 8 月 23 日起调整 API 计费规则,周六日全天统一按低谷价收费。调整距离峰谷定价机制实施仅一周。新的周末计费规则简化了计费逻辑,开发者可享受低谷时段价格。以 DeepSeek-V4-Pro 为例,高峰时段每百万 tokens 输出价格为 27 元,空闲时段为 13.5 元。

推荐理由:DeepSeek 又调整了 API 计费规则,周末统一按低谷价收费,对开发者来说更实惠了。和之前的峰谷定价相比,这次调整更简单,价格也更优惠。
8月21日
22:43
19:58
19:53
18:38
18:04
18:03
14:34
13:03
8月20日
23:04
23:04IT之家博客/媒体
Meta 通过微软 Azure 云服务采购 AI 服务,年支出高达数亿美元。Meta 每周通过 Azure 消耗的 AI 算力达到了数万亿词元。微软 Azure 的 Foundry 平台提供来自 OpenAI、Anthropic、DeepSeek 等多家供应商的模型,模式总数达 11604 个。微软 AI 业务对少数科技企业客户的依赖程度同样较高,OpenAI 在微软最近一个财年贡献了约 70% 的整体 AI 营收。
事件专题

推荐理由:Meta 每年花数亿美元在微软 Azure 买 AI 算力,每周消耗数万亿词元。微软 Foundry 平台有 11604 个模型,但营收主要靠 OpenAI,客户也集中在 Meta、字节跳动这些大厂。