01:07官方一手marktechpost@Asif Razzaq79°DeepSeek开源了DSpark框架,通过将草稿模块附加到现有DeepSeek-V4权重上实现推测解码。它结合并行草稿骨干和轻量级马尔可夫头来减少后缀衰减,并加入基于置信度的调度验证,根据实时GPU负载调整检查token数量。离线测试中,接受长度相比DFlash和Eagle3提升16-31%;生产环境中每个用户生成速度比MTP-1基线提升57-85%,且无损。训练代码DeepSpec以MIT许可证开源。AI模型DSparkDeepSeek-V4DeepSeek1 个信源在谈事件专题推荐理由:DeepSeek搞了个DSpark,让V4推理速度翻倍,开源还无损,适合高并发场景。原文稍后读已读值得跟进有用关注 DSpark
00:49Geek@geekbb73°DeepSeek 在 Pro Max 模式下于多个编码/工程基准取得领先成绩:LiveCodeBench 93.5%、Codeforces Rating 3206、SWE Verified 80.6%,超越 GPT-5.4、Gemini 3.1 Pro、Claude Opus 4.6 等闭源模型。这些结果来自 X 用户 @geekbb 的推文,并关联到 DeepSeek 的 Hugging Face 仓库。目前该模型尚未开放本地部署,引发社区期待。AI模型DeepSeekPro Max编码基准推荐理由:DeepSeek 拿 Pro Max 模式在 LiveCodeBench 等三大编码基准上直接碾压 GPT-5.4 和 Claude Opus 4.6,分数拉满,但还没开放下载,先来围观一下。原文稍后读已读值得跟进有用关注 DeepSeek
16:27官方一手Pandaily@contact@pandaily.com (Pandaily)DeepSeek放弃了“不融资、不商业化”的立场,获得创纪录的70亿美元融资。该公司计划将所有部门的规模扩大一倍。同时推出Harness AI编码代理团队,与Anthropic的Claude Code直接竞争。行业DeepSeekHarnessClaude Code10 个信源在谈事件专题推荐理由:DeepSeek拿了70亿美金扩招一倍,新出的Harness AI编程工具对标Claude Code,AI竞争又升级了。原文稍后读已读值得跟进有用关注 DeepSeek
16:21IT之家(博客/媒体)美国企业 AI 账单持续失控,Lindy 公司此前每月调用 Anthropic 的 Claude 模型,账单超过所有员工工资。其 CEO Flo Crivello 本月初将 100% 流量切换至 DeepSeek,称未来几个月可节省数百万美元。Uber 也为部分 AI 工具设定了每月 1500 美元的分级支出上限。企业开始采用“模型路由”按任务匹配模型,不再将最贵的前沿模型用于所有场景。行业DeepSeekClaudeLindy10 个信源在谈事件专题推荐理由:Lindy 公司从 Claude 全切到 DeepSeek,省下数百万美元,还立竿见影降成本。想控制 AI 账单的企业可以看看他们怎么做到的。原文稍后读已读值得跟进有用关注 DeepSeek
15:51IT之家(博客/媒体)76°6月27日,北大与DeepSeek联合开源DSpark推理加速框架,已部署于DeepSeek-V4-Flash与V4-Pro预览版引擎。该框架相比单token推测解码基线MTP-1,在同等吞吐量下将单用户生成速度提升60%至85%。DSpark采用半自回归架构,在Qwen3-4B模型上平均接受长度比Eagle3提升约30.9%,比DFlash提升约16.3%。V4-Flash引擎实测中,80 token/s SLA下聚合吞吐量提升51%,120 token/s下提升661%。相关论文、训练代码及模型检查点已在GitHub DeepSpec项目开源。AI模型DeepSeekDSpark北京大学1 个信源在谈事件专题推荐理由:北大和DeepSeek开源了DSpark,能让高并发下大模型生成速度提升最多85%。想提速可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
23:30官方账号Decoder@Matthias BastianAI初创公司Lindy因AI成本超过人员成本,完全放弃Anthropic的Claude模型,转而采用DeepSeek。CEO Flo Crivello称此举是“为了企业生存”。这一变更预计每年节省数百万美元。事件反映了AI模型成本压力对初创公司决策的直接影响。行业LindyDeepSeekClaude10 个信源在谈事件专题推荐理由:Lindy为了省钱,把Claude全换成了DeepSeek,省了几百万美元。这家公司说再不用DeepSeek就活不下去了——模型价格战就是这么现实。原文稍后读已读值得跟进有用关注 Lindy
22:42Gary Marcus@GaryMarcusUBS调查显示,60%监控AI预算的企业已开始转向更便宜的模型和开源中国模型。企业面临极端账单,有用户每月花费高达35,000美元,团队超出配额200%,部分公司从5个AI内部工具削减至2个。企业通过模型路由策略,将简单任务分配给便宜模型,如Qwen、DeepSeek、MiniMax、GLM、Kimi,而保留高级模型用于推理、编程和长上下文任务。这些中国开源模型可以本地运行或通过云目录使用,符合企业成本曲线。行业UBSDeepSeekQwen推荐理由:大厂AI账单太高了,UBS说60%的企业已经在换更便宜的模型,像DeepSeek、Qwen这些中国开源模型成了新选择。想省钱的企业可以看看这个趋势。原文稍后读已读值得跟进有用关注 UBS
15:58李继刚@lijigang_com长期与Claude或DeepSeek等模型对话,你的语言风格会不自觉地模仿对方。重度使用后,说话会带出「Claude味儿」「DeepSeek味儿」。进行30天月度主题阅读,沉浸在同一主题的上下文中,能加深理解并切换看问题视角。技巧ClaudeDeepSeek语言风格推荐理由:长期用Claude或DeepSeek聊天,说话会带味儿,还能用主题阅读切换视角,亲测有效原文稍后读已读值得跟进有用关注 Claude
09:59官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek 近期从工程效能平台 Harness 积极招募工程师,同时计划自建计算基础设施。此举标志其 AI 战略从依赖外部算力转向自建重型模式。公司旨在通过自主算力降低成本并提升效率。行业DeepSeekHarnessAI基础设施推荐理由:DeepSeek 不满足于租别人的算力,开始自己建了。他们正猛挖 Harness 的工程师,从轻模式转向重资产,这可能会改变行业格局。原文稍后读已读值得跟进有用关注 DeepSeek
09:30官方一手arXiv: OpenAI@Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv这篇来自 arXiv 的论文系统梳理了多模态大语言模型(MLLM)中视觉-语言感知的演变,首次将其视为统一的跨模态能力。论文提出了五阶段分类法,涵盖从早期方法到 OpenAI O-series、DeepSeek R-series 等最新模型带来的感知中心范式转变。它总结了每个阶段的代表性方法,并指出了开放挑战与通向通用智能的研究方向。该综述为 MLLM 感知研究提供了结构化理解与可操作的路线图。论文O-seriesR-seriesOpenAI7 个信源在谈事件专题推荐理由:想搞懂多模态模型怎么从分开看图文进化成统一感知?这篇综述用五阶段框架讲清了O-series和R-series带来的转变,比碎片化教程系统得多。原文稍后读已读值得跟进有用关注 O-series
14:56IT之家(博客/媒体)胡润《2026全球独角兽榜》发布,全球独角兽达1603家,总价值54万亿元,较去年增长43%。美国以806家居首,中国381家第二。Anthropic以6.6万亿元价值跃居全球第一,OpenAI(5.8万亿元)第二,字节跳动(3.3万亿元)第三。新晋独角兽DeepSeek以3400亿元价值跻身前15名。行业AnthropicOpenAI字节跳动10 个信源在谈事件专题推荐理由:胡润榜单新鲜出炉:Anthropic超OpenAI成全球最贵独角兽,DeepSeek杀入前15,看看谁上榜了。原文稍后读已读值得跟进有用关注 Anthropic
13:45官方一手marktechpost@Asif Razzaq精选百度开源Unlimited OCR,一个3B参数的MoE模型,能在单次前向推理中解析数十页文档。其突破性的Reference Sliding Window Attention (R-SWA)机制使KV缓存保持恒定,随着输出增长内存和延迟不变。模型在OmniDocBench v1.5基准上获得93.23分,比DeepSeek OCR基线高出6.22分。该模型采用MIT许可证开源。AI模型Unlimited OCRBaiduDeepSeek5 个信源在谈事件专题推荐理由:百度开源了一个3B参数的OCR模型,能一口气解析几十页文档,KV缓存不膨胀,性能直接碾压DeepSeek。原文稍后读已读值得跟进有用关注 Unlimited OCR
16:09IT之家(博客/媒体)特斯拉中国车机确认接入豆包大模型,语音交互升级进入落地阶段。内测版本2026.14.11的应用列表中已出现豆包AI助手入口。豆包负责车辆控制(空调、车窗、导航等),DeepSeek负责闲聊问答,分工明确。此前2024年8月特斯拉官网条款已披露将接入火山引擎Doubao和DeepSeek Chat。AI产品特斯拉豆包DeepSeek1 个信源在谈事件专题推荐理由:特斯拉车主很快就能用豆包语音控车了,豆包管车控、DeepSeek管聊天,体验接近Grok。原文稍后读已读值得跟进有用关注 特斯拉
14:25OpenRouter@OpenRouterAIOpenRouter 分享了 GLM 和 DeepSeek 两个模型家族的版本采用时间线图。数据展示了用户在不同版本之间的迁移趋势。图表包含 2 条回复、2 次转发、29 个喜欢和 3042 次查看。这反映了开源模型社区的版本使用动态。行业OpenRouterGLMDeepSeek推荐理由:想了解 GLM 和 DeepSeek 用户都升级到了哪个版本?OpenRouter 这张图一目了然。原文稍后读已读值得跟进有用关注 OpenRouter
12:04官方一手arXiv: DeepSeek@Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan精选RLM-Cascade是一个代理层投机解码系统,在响应级别优化LLM API调用。它使用DeepSeek作为草稿模型、Opus作为验证模型,并通过轻量复杂度路由器选择路径。在Claude Code生产环境中,系统达到88.8%的草稿使用率,API成本相比直接使用Opus降低45.8%。P50延迟从3698毫秒降至2026毫秒,实现1.83倍加速。在20个Code/Math/Instruct任务基准上,RLM-Cascade通过率达100%,高于Opus的95%。AI模型RLM-CascadeDeepSeekOpus推荐理由:这个系统把DeepSeek和Opus组合起来,用投机解码省了近一半API成本,还快了一倍,质量也有提升,而且开源可部署。原文稍后读已读值得跟进有用关注 RLM-Cascade
08:05berryxia@berryxia百度开源了Unlimited OCR模型,采用R-SWA(参考滑动窗口注意力)机制,一次前向推理即可处理32K上下文的文档,数十页PDF无需分块。与传统逐页处理的OCR不同,其KV Cache大小恒定,不随长度增长。模型灵感源于人类抄书行为,仅维护近128个状态。技术报告核心贡献者中,技术总监YY疑为DeepSeek前员工。AI模型Unlimited OCR百度DeepSeek6 个信源在谈事件专题推荐理由:百度开源的Unlimited OCR能一口气读完几十页PDF,不用切块,快又准。技术总监YY可能是DeepSeek出走的,有意思。原文稍后读已读值得跟进有用关注 Unlimited OCR
00:24向阳乔木@vista8DeepSeek Harness组作为新部门,正在大规模招聘三种职位:Harness研究员(实习/全职)、Harness工程师(实习/全职)、Harness产品经理(限全职)。招聘流程与其他部门一致,包含一轮笔试和三轮面试,终面由Tianyi Cui负责。职位空缺较大,简历可直接私信发送。行业DeepSeekHarness组Tianyi Cui推荐理由:DeepSeek Harness组在招研究员、工程师和产品经理,门槛不低但机会难得,想加入国产大模型核心团队的朋友可以试试看。原文稍后读已读值得跟进有用关注 DeepSeek
22:27shao__meng@shao__mengDeepSeek 新成立的 Harness 组由 Tianyi Cui 带队,目标远大、工作繁重,目前仍非常缺人。招聘共三种职位:Harness 研究员(实习/全职)、Harness 工程师(实习/全职)、Harness 产品经理(限全职)。招聘流程为一轮笔试加三轮面试,终面由 Tianyi Cui 负责。该组专注于 Agent Harness 研究和工程,职位空缺较大但门槛与 DS 其他组一致。行业DeepSeekHarness招聘推荐理由:DeepSeek Harness 组在招人,研究员、工程师、产品经理都要,做 Agent Harness 的可以直接投简历。门槛不低但机会大。原文稍后读已读值得跟进有用关注 DeepSeek
03:54Suhail@Suhail精选Z.ai推出GLM-5.2开源模型,采用MIT开放权重。该模型支持1M上下文窗口,在Terminal-Bench 2.1基准上得分81.0,仅比Claude Opus 4.8低几分。Perplexity CEO此前指出,中国已拥有最强开源模型DeepSeek,且美国开发者正基于其构建应用。GLM-5.2的发布进一步表明开源AI竞赛已非理论。AI模型GLM-5.2Z.aiDeepSeek推荐理由:Z.ai刚刚放出了GLM-5.2,MIT开源、100万上下文、跑分81.0,跟Claude Opus 4.8差距很小,做开源模型的得看看。原文稍后读已读值得跟进有用关注 GLM-5.2
11:16官方一手pandaily@contact@pandaily.com (Pandaily)精选76°DeepSeek完成其首次外部融资轮,募资超过500亿元人民币。本轮融资采用无投票权结构,战略投资者包括腾讯、宁德时代和京东等。这是国内AI公司最大规模的单轮融资之一,将用于支持其大模型研发与基础设施扩展。行业DeepSeekTencentCATL推荐理由:DeepSeek刚融了500多亿,腾讯、宁德时代这些大厂都跟投了,说明行业对它技术路线的认可。原文稍后读已读值得跟进有用关注 DeepSeek
00:37Geek@geekbb精选一个名为 handoff 的开源工具让你在 Claude Code 或 Codex 会话中直接委托任务给 DeepSeek 等其他模型。典型用法是让 Claude 负责规划与审阅,DeepSeek 负责执行代码。这种方式能降低 API 成本,同时保持高开发效率。该方案已获得社区关注,相关仓库在 GitHub 上可见。技巧ClaudeDeepSeekClaude Code推荐理由:想省钱又能干活?让 Claude 当项目经理、DeepSeek 当写代码的,这个工具帮你搞定。原文稍后读已读值得跟进有用关注 Claude
22:03IT之家(博客/媒体)79°DeepSeek于本周完成首次外部融资,估值超过500亿美元(约3387.1亿元人民币)。公司一直拒绝外部融资,但在核心人才流失后启动融资计划。传闻创始人梁文锋向潜在资方提出承诺不挖走DeepSeek员工的要求。此前开发DeepSeek V3的罗福莉已转投小米,其团队推出的AI模型在基准测试中超越DeepSeek产品。行业DeepSeek融资人才流失推荐理由:DeepSeek首次外部融资估值惊人,还要求投资人别挖自己人,这人才战打得挺有意思。原文稍后读已读值得跟进有用关注 DeepSeek
15:52IT之家(博客/媒体)DeepSeek 识图模式已在网页和 App 端正式上线,App 端标注“图片理解功能内测中”,网页端无此提示。该模式与快速模式、专家模式并列,支持用户上传图片让 DeepSeek 解读。其能力不仅是文字提取,还能理解图像内容。背后的多模态模型技术已于今年 4 月公开,核心框架名为“Thinking with Visual Primitives”。AI产品DeepSeek识图模式多模态推荐理由:DeepSeek 现在能识图了,App 和网页都能用,不只是 OCR,还能理解画面,背后有专门的多模态技术。原文稍后读已读值得跟进有用关注 DeepSeek
09:21官方一手arXiv: DeepSeek@Yifu Ding, Jiacheng Wang, Ge Yang, Yongcheng Jing, Jinyang Guo, Xianglong Liu, Dacheng Tao精选该论文针对混合专家(MoE)模型部署时内存和推理开销大的问题,提出一种结构剪枝框架。方法将剪枝比率分配转化为通道分数覆盖最大化问题,通过归因近似高效求解。在DeepSeek和Qwen MoE模型上实验,结合4-bit量化后,50%或25%结构化剪枝仍保持模型准确率。在Qwen3-30B-A3B上,内存占用减少5.27倍,优于现有基线。论文MoE结构剪枝量化推荐理由:想省显存又怕掉精度?这篇论文用通道级剪枝加4-bit量化,把MoE模型体积砍到1/5还能保住性能,DeepSeek和Qwen都能用。原文稍后读已读值得跟进有用关注 MoE
08:03IT之家(博客/媒体)DeepSeek于6月16日完成首轮外部融资,整体规模约510亿元,企业估值近4000亿元。投资方包括创始人梁文锋、腾讯、宁德时代、网易、京东、IDG资本及国家人工智能产业投资基金。融资将用于扩展AI基础设施、加强研发、员工股权激励及加快商业化进程。这是DeepSeek首次引入外部资本,估值在国内AI创业公司中处于领先水平。行业DeepSeek腾讯宁德时代推荐理由:DeepSeek拿了510亿,估值4000亿,腾讯、宁德时代都投了,AI赛道钱景真猛原文稍后读已读值得跟进有用关注 DeepSeek
00:35Geek@geekbb从2022年期待本地运行ChatGPT-3.5,到2026年DeepSeek、Qwen、GLM、Kimi每月发布旗舰模型。本地部署模型列表包括GLM-4、DeepSeek R1/V3、Qwen3、Kimi-K2、GPT-oss-120b、Qwen3.7-Plus、Kimi-K2.7、Deepseek-V4、GLM-5.2等九个版本。迭代速度远超预期,社区感叹没有尽头。行业DeepSeekQwenGLM推荐理由:这帖子把2022到2026国产模型进化史盘得清清楚楚,DeepSeek、Qwen、GLM、Kimi每月一个旗舰,本地部署清单都快十个版本了,AI发烧友必看。原文稍后读已读值得跟进有用关注 DeepSeek
23:33IT之家(博客/媒体)91°DeepSeek 于 2026 年 6 月 16 日完成首轮外部融资,融资规模约 510 亿元,企业估值近 4000 亿元。投资方包括创始人梁文锋、腾讯、宁德时代、网易、京东、Monolith 砺思资本、IDG 资本、正心谷投资、拾象科技以及国家人工智能产业投资基金。DeepSeek 成立于 2023 年 7 月 17 日,此前由母公司幻方量化全资支持,其量化业务巅峰期管理资产规模超 700 亿元。本轮融资将用于扩展 AI 基础设施、加强研发、员工股权激励及加快商业化。行业DeepSeek腾讯宁德时代推荐理由:DeepSeek 拿到 510 亿首轮融资,估值 4000 亿,腾讯、宁德时代、京东都投了,梁文锋亲自把关,五年锁定期只留长线资本。原文稍后读已读值得跟进有用关注 DeepSeek
09:55官方一手pandaily@contact@pandaily.com (Pandaily)76°DeepSeek完成首次外部融资,金额超过74亿美元(500亿元人民币)。本轮融资后公司估值突破500亿美元。融资结构特殊,投资者获得经济权益但无投票权。行业DeepSeek融资估值推荐理由:DeepSeek首轮融资就拿到超500亿美元估值,而且投资人不要投票权,挺有意思的。原文稍后读已读值得跟进有用关注 DeepSeek
09:31官方一手arXiv: DeepSeek@Esteban Schafir, Xu Zheng, Hojat Allah Salehi, Zhuomin Chen, Mo Sha, Wei Cheng, Dongsheng Luo精选DecoSearch是一个无需训练的Text-to-SQL框架,通过轻量级Schema Selector修剪数据库模式,LLM Judger判断查询是否需要分解为DAG子问题。在BIRD上达到70.53%执行准确率,在Spider上达88.31%,使用DeepSeek作为骨干模型,比训练无关基线消耗少一个数量级的token。该方法还可作为模型无关包装器,一致提升微调后的SQL生成骨干性能。AI模型DecoSearchDeepSeekText-to-SQL推荐理由:DecoSearch不用训练就能把自然语言转SQL,在BIRD和Spider上准确率分别超70%和88%,比同类方法省十倍token。想提升SQL生成效率可以看看。原文稍后读已读值得跟进有用关注 DecoSearch
09:31官方一手arXiv: DeepSeek@Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang该论文提出了LLM代码推理的内部生命周期概念:模型先在早期层中酝酿答案,使其线性可解,然后在后期层分化为四种解析结果——已解析、过度处理、错误解析、未解析。研究对Qwen、Llama、DeepSeek三个架构的16个模型进行了6类代码推理任务的层析探针和上下文剥离解码(CSD)实验。结果显示已解析平均仅41.5%,且函数调用任务中,调用深度从1层增至3层时已解析率从61.1%骤降至2.5%。所有模型的酝酿持续时长稳定在24%-42%,但解析成功率随模型能力和规模变化。论文代码推理QwenLlama推荐理由:这篇论文用层析探针找到了LLM做代码推理时“酝酿”到“解析”的秘密,发现即便准确率相近,内部失败模式也截然不同,值得想理解推理本质的人读。原文稍后读已读值得跟进有用关注 代码推理
04:02Gary Marcus@GaryMarcus微软正在探索将DeepSeek作为Copilot Cowork的底层模型,替代OpenAI和Anthropic。同时Copilot Cowork转向基于使用量的定价模式,微软表示有用户每周执行数百个任务,成本可能非常高。这一举动被分析认为伤害了OpenAI和Anthropic的潜在IPO。事件涉及Jevons悖论,即效率提升可能导致总用量增加。行业微软DeepSeekOpenAI10 个信源在谈事件专题推荐理由:微软可能换掉OpenAI和Anthropic,改用DeepSeek给Copilot Cowork,还改了按用量收费。这事直接影响两家公司上市计划,值得关注。原文稍后读已读值得跟进有用关注 微软
03:38@koltregaskes@koltregaskesDeepSeek 4.1 版本预计于本周发布。该版本是 DeepSeek 系列的最新迭代,具体性能数据尚未公布。用户可关注官方渠道获取更新信息。AI模型DeepSeekDeepSeek 4.1模型发布推荐理由:DeepSeek 要发新版本了,听说这周就上线,看看有什么进步。原文稍后读已读值得跟进有用关注 DeepSeek
18:28官方账号Decoder@Jonathan Kemper73°中国AI初创公司DeepSeek在首次外部融资轮中筹集超过50亿人民币(约7.4亿美元),公司估值达到500亿美元。这是DeepSeek首次接受外部投资,此前主要依赖内部资金。该轮融资由多家机构参与,显示出市场对DeepSeek技术实力的认可。行业DeepSeek融资估值推荐理由:DeepSeek第一次拿外部钱,融了74亿美元,估值冲到500亿,看看这家中国AI新势力怎么做到。原文稍后读已读值得跟进有用关注 DeepSeek
16:29掘金本周最热@CodeSheep梁文锋在2002年以806分成为当地高考状元,考入浙江大学电子信息工程专业。2007年他在浙大攻读研究生,师从项志宇教授研究计算机视觉。2015年,他与同学创立幻方量化,管理资产规模一度突破千亿。2023年,他创立DeepSeek,推出R1模型引发全球关注。行业DeepSeek梁文锋幻方量化推荐理由:讲梁文锋从高考状元到量化天王再到DeepSeek的完整经历,里面他的一些思考挺有启发。原文稍后读已读值得跟进有用关注 DeepSeek
14:29IT之家(博客/媒体)DeepSeek完成超70亿美元(约474亿元人民币)融资,估值超过500亿美元,创中国AI行业单轮融资纪录。此轮融资采用特殊结构,投资者享有经济权益但无投票权,且面临五年锁定期,仅国家人工智能产业投资基金直接注资10亿元并获投票权。腾讯、宁德时代、京东、网易及IDG资本参与投资,其中腾讯拟投100亿元,宁德时代计划出资50亿元。DeepSeek凭借V3大模型与R1推理模型获得全球关注,成为中国AI标杆企业。行业DeepSeek腾讯宁德时代推荐理由:DeepSeek刚拿到超70亿美元投资,腾讯、宁德时代都掏钱了,但全都没有投票权。这一轮是中国AI最大单轮融资,说明资本对它的V3和R1模型信心爆棚。原文稍后读已读值得跟进有用关注 DeepSeek
11:56官方一手arXiv: DeepSeek@Yingnan Zhao, Razvan Bunescu, Ahmed Louri, Avinash Karanth, Ke Wang针对MoE模型(如Qwen、DeepSeek)推理中专家加载延迟高的问题,研究者分析了专家选择行为,发现相邻MoE层和连续解码token间专家请求存在强相关性。基于此提出ST-MoE,一个结合轻量级运行时预测机制与可重构硬件设计的专家预取框架。ST-MoE通过预取专家与计算重叠,显著提升推理性能并降低能耗,同时保持模型精度。实验在多种MoE模型和应用(语言理解、代码生成)上验证了有效性。论文MoEQwenDeepSeek推荐理由:这篇论文分析了Qwen、DeepSeek等MoE模型的专家加载瓶颈,用ST-MoE框架通过预取专家来加速推理,兼顾效率和精度,适合关注大模型推理优化的读者。原文稍后读已读值得跟进有用关注 MoE
10:47官方一手arXiv: DeepSeek@Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan论文在Qwen2.5、LLaMA-3和DeepSeek三个系列上发现:用小模型自身生成并通过拒绝采样选取的轨迹,比用更强Oracle模型精炼的高奖励数据,能更有效提升数学推理。Oracle精炼虽修复逻辑,但引入分布偏移,增加小模型适应成本,抵消了逻辑改进的收益。作者提出风格对齐精炼(Style-Aligned Refinement),保留小模型原生轨迹风格同时融入Oracle逻辑修复,降低适应成本并恢复下游效用。该发现挑战了数学推理蒸馏中依赖奖励模型分数选择数据的常规做法。论文Qwen2.5LLaMA-3DeepSeek推荐理由:这篇论文揭穿了一个直觉错误:你以为给小白模型喂“学霸笔记”能变强,结果效果还不如它自己瞎写的解题草稿。原因是学霸的思路和它不匹配,硬学反而费劲。原文稍后读已读值得跟进有用关注 Qwen2.5
11:12Geek@geekbb这是一个开源的 Windows 小工具,可以实时监控 DeepSeek API 的余额和用量。它通过调用 DeepSeek 官方 API 接口获取数据,并在本地展示剩余额度。工具适用于需要管理 DeepSeek 账户 API 消耗的用户。GitHub 上提供了安装和使用说明。AI产品DeepSeekAPI余额监控推荐理由:能实时看 DeepSeek API 余额原文稍后读已读值得跟进有用关注 DeepSeek
10:20向阳乔木@vista8精选该工具输入任意App名称即可自动抓取AppStore用户评价,并通过DeepSeek进行四类信息挖掘:用户正面/负面评价、问题与版本更新的关联、产品机会识别、可视化图表输出。产品预计下周开源,可帮助产品经理快速从评论中提取 actionable 信息。技巧DeepSeekAppStore产品经理推荐理由:帮你用DeepSeek挖掘AppStore评论,找出产品机会原文稍后读已读值得跟进有用关注 DeepSeek
13:21IT之家(博客/媒体)小米新媒体高级工程师@小米_邹師傅发文评论某大模型重新出山,表示技术竞争值得欢迎,但担忧对方可能采用刷榜、刷屏、捆绑国产算力与情怀的营销手段。他指出国内大模型圈已形成靠作品说话的氛围,如DeepSeek靠开源、MiMo靠论文、Qwen靠开发者口碑。他警告新选手若以饱和舆论轰炸入场,将污染技术赛道。小米此前已发布MiMo-V2.5系列模型并永久降价,最高降幅达99%。行业小米MiMoDeepSeek推荐理由:小米工程师谈大模型竞争,警惕营销战原文稍后读已读值得跟进有用关注 小米