9月1日
22:53
22:53OpenRouter@OpenRouterAI
78°
Mercury 2.5 Preview推理模型在OpenRouter平台发布,速度达1,107 tokens/sec。该模型支持并行token生成和并行工具调用功能。模型具有可调节推理能力和schema-aligned JSON输出。专为低延迟工作负载设计。
推荐理由:Mercury 2.5 Preview来了,推理速度超1100 tokens/sec,还支持并行工具调用,比普通模型快多了。
15:13
12:10
12:10官方账号arXiv cs.LG@Nikita Koriagin, Yaroslav Aksenov, George Bredis, Gleb Gerasimov, Nikita Balagansky, Daniil Gavrilov
精选73°
研究人员提出Soft Latent Thinking方法,在推理过程中用轻量投影器替代大词汇量头。在DeepSeek-Qwen-1.5B和LLaMA-3.2-3B模型上测试,该方法在所有k值下均提升pass@k指标,同时减少思维链每步计算量。该方法在所有软思维方法中达到最高pass@32,证明连续空间可有效进行推理。
推荐理由:新方法让模型在嵌入空间连续推理,不生成离散token,性能还提升了。
11:22
11:22官方账号arXiv cs.AI@Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo
78°
该研究探讨了大型推理模型(LRM)如何随着人类监督逐渐退出学习循环而持续改进。论文提出了从L0到L4的五级阶梯,追踪学习过程中哪些部分仍受人类控制。研究分析了奖励机制从单个人类判断发展到可重用验证器的过程,以及学习从人工策划任务向自主生成课程和环境演进的路径。
推荐理由:这篇论文系统分析了大推理模型如何减少人类依赖,提出了五级发展阶梯和三种评估对象。
09:15
09:15官方账号arXiv cs.AI@Yangsong Lan, Renkai Hu, HongKai Zheng, Bo Zhang, Renzhi Wang, Hongliang Dai, Piji Li
精选73°
研究团队提出MI-Distillation框架,通过模型插值构建连续推理数据谱。该方法引入SeqLSS评分机制,选择既具信息量又易于学生模型学习的推理路径。实验表明,该方法在多个推理基准上均优于强基线Long CoT方法,显著提升小模型思维链蒸馏效果。
推荐理由:MI-Distillation解决了大模型推理轨迹蒸馏到小模型的难题,通过模型插值和SeqLSS评分提升蒸馏效果。
08:13
08:13lmarena.ai@lmarena_ai
精选
Qwen3.8-Flash-Next 在整体排名中位列第24位,净提升2.4%。在开源模型中排名第7位。Confirmed Success指标提升12.3%,Bash Recovery提升2.9%。Praise vs. Complaint指标下降1.6%,Steerability下降1.1%。该模型没有工具幻觉问题。

推荐理由:阿里Qwen3.8-Flash-Next在LMSYS排行榜上表现亮眼,开源模型中排名第7,Confirmed Success指标大幅提升。
8月31日
09:09
09:09官方账号arXiv cs.LG@Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais
精选73°
研究显示滑动窗口注意力(SWA)在多个大语言模型的各种下游任务上表现与或优于后训练线性注意力模型。在长上下文推理任务中,SWA性能比线性注意力高2到10倍。SWA无需后训练,速度快且内存需求低。
推荐理由:SWA比线性注意力更高效,无需后训练就能实现更好性能,内存占用低,推理速度快。
8月30日
08:47
8月29日
15:06
15:06Fireworks AI@FireworksAI_HQ
精选
GLM-5.3-Flash 模型在 Fireworks 平台正式上线发布。该模型因存在两天无法解释的推理长度延迟而被推迟发布。相同权重不代表相同模型质量。开发者可在 fireworks.ai/models/firewor 开始使用该模型。
事件专题

推荐理由:Fireworks 发布了 GLM-5.3-Flash,强调质量优先,相同权重不代表相同模型,开发者可立即开始构建应用。
8月28日
23:17
23:17官方账号LangChain@LangChainAI
精选
PodiumHQ的代理行为看似异常,但LangSmith追踪显示代理实际上基于已有上下文做出了理性决策。首席软件工程师Walker Ward详细介绍了端到端追踪代理推理过程的方法。LangSmith工具帮助开发者理解AI代理的实际工作方式。
推荐理由:Walker Ward分享如何用LangSmith追踪PodiumHQ代理推理过程,揭示看似异常行为背后的真实逻辑。
19:25
19:25官方账号arXiv cs.LG@Yunpeng Ba, Zhi Zheng, Yue Xie, Jiaqing Li, Xialiang Tong, Tao Zhong, Mingxuan Yuan, Zhichao Lu, Xuyang Wu, Zhenkun Wang
精选73°
研究显示进化策略(ES)在LLM推理训练中表现优于GRPO方法。ES在Pass@1基准上提升性能,同时获得比GRPO更高的Pass@K分数。ES仅需更大模型中的较小种群规模即可有效工作。研究还发现ES的功能稀疏性表明大量参数移动不一定导致广泛功能变化。
推荐理由:这篇论文对比了ES和GRPO两种训练方法,发现ES能带来更广泛的推理覆盖,还提出了结合两者优势的GRPO-ES顺序训练策略。
18:04
18:04官方一手arXiv: DeepSeek@Maciej Besta, Leonard Schmidt, Lara Nonino, Robert Gerstenberger, Pierre Pang, Patrik Okanovic, Ales Kubicek, Tiancheng Chen, Baraq Lipshitz, Torsten Hoefler
精选73°
本文系统化分析了RL-for-LLM范式,对PPO、GRPO等主流后训练算法框架进行了计算中心分析。作者提出了推理语言模型(RLMs)的并行策略分类法,涵盖数据、张量、流水线等传统技术以及解耦放置、阶段融合等新型并行技术。研究还分析了现有RLM框架,并构建了可扩展、快速且经济高效的RLM实践指南。
推荐理由:这篇论文帮你搞懂RL-for-LLM的并行训练策略,让DeepSeek-R1、o3这些推理模型训练不再那么烧钱。
17:08
17:08AI Will@FinanceYF5
73°
Z. ai创始人jietang公布Ox Alpha实际为GLM-5.3 Flash模型。该模型AA得分57,价格为前沿模型的1/100,完全由国产芯片驱动。在OpenRouter周Token份额接近20%,排名第一,推动Z.ai整体份额超过DeepSeek。
事件专题

推荐理由:Z.ai新发布的GLM-5.3 Flash性能强劲且价格低廉,国产芯片驱动,市场份额已超越DeepSeek。
8月27日
23:16
23:16官方账号Decoder@Matthias Bastian
78°
OpenAI研究员警告,最先进的AI模型运行速度可达50倍,可能在人反应之前渗透系统。他表示,简单的监控不再适用,需要自主关闭系统。此警告伴随OpenAI发布一款新AI芯片,其在推理速度上显著优于现有硬件。
事件专题

推荐理由:OpenAI新AI芯片发布,推理速度大幅提升,但研究员警告超快AI可能让安全团队落后,提醒关注自主关闭系统的重要性。
15:09
8月26日
14:58
11:22
11:22官方账号arXiv cs.AI@Yogesh Kumar
精选
近期研究将Mamba风格状态空间模型(SSMs)应用于视频异常检测,但现有方法仍依赖缓冲剪辑或窗口,缺乏对时间记忆与检测延迟关系的理论解释,仅通过GPU吞吐量而非目标边缘硬件来基准效率。我们引入了一种严格因果流异常检测器,其固定大小状态每帧更新时间为O(1),无前瞻和无剪辑缓冲。其时间核心是一个对角线性状态空间递归,具有输入和状态依赖的衰减门,通过在冻结视觉骨干上的因果下一嵌入预测进行自监督训练。我们推导出递归衰减频谱与检测延迟和可可靠捕获的最短异常之间的封闭形式关系,然后在UCSD Ped2和CUHK Avenue上进行实证验证。从学习到的基衰减(57到59帧)预测的收敛延迟界限远高于测量的检测延迟(1.6和18.4帧),表明事件边界门而不是基衰减控制响应速度。我们进一步报告了在Apple M3 Pro硬件上直接测量的端到端延迟和吞吐量,每帧0.74毫秒和0.77毫秒(超过1300 FPS),而不是模拟的GPU数字。未经调整的初始配置下,该方法在Ped2和Avenue上达到67.9%和70.2%的帧级AUC,略低于先前非因果SSM基线。在衰减率、状态大小和门控上的消融实验表明,门控贡献与数据集大小相关,在较小的Ped2训练集上损害准确性,但在较大的Avenue集上有所帮助。缩小准确性差距并将评估扩展到第三个更大的基准是下一步的紧急任务。
推荐理由:这篇论文介绍了一种新的视频异常检测器,它具有更快的响应速度和更高的准确性,值得专业人士关注。
10:33
00:44
00:44ollama@ollama
精选
IBM推出Granite 4.2模型,参数量达3B、8B、30B,适用于企业智能体,免费使用,支持研究及商业用途。模型针对企业场景定制,融合治理、风险和合规评估。Granite 4.2具备推理能力,可自动化复杂工作流程。
推荐理由:IBM新模型Granite 4.2上线Ollama,参数量达30B,免费使用,适合企业智能体,功能强大,值得一试。
8月25日
16:14
10:15
8月24日
23:34
02:33
8月23日
17:13
8月22日
12:08
07:23
05:34