7月1日
09:40
09:40官方账号arXiv cs.LG@Zena Al-Khalili, Rafi Hakim, Dietrich Klakow, Ji-Ung Lee
Fork-Think提出一种新范式:先通过模型置信度在单条路径上识别分流点,再触发多分支采样并聚合。在三个模型和三个推理基准上,相比并行思考,Fork-Think节省了30%的token消耗和57%的推理时间,性能持平或更优。结合早停和加权投票后,无需预热即可达到现有最优方法。
推荐理由:Fork-Think让LLM推理更省钱省时间——先找准关键点再思考,token少用30%,速度快57%,效果还不输并行方法。
08:52
08:12
05:45
05:45官方账号Simon Willison’s Weblog博客/媒体
Anthropic 发布了 Claude Sonnet 5,其性能接近 Opus 4.8 但价格更低。模型支持 1M 上下文窗口和 128K 输出 token,自适应思考默认开启。新 tokenizer 使英文文本 token 数增加约 30%,实际成本上升约 30%。定价保持 Sonnet 4.6 水平:$3/百万输入、$15/百万输出,8月31日前有折扣。
事件专题

推荐理由:Anthropic 刚发了 Sonnet 5,性能接近 Opus 4.8 但更便宜,不过新 tokenizer 会让你的账单多掏 30%,用之前先算好账。
03:18
02:17
02:17官方账号NVIDIA AI@NVIDIAAI
Nemotron Labs发布了一项基于5000名Kaggle竞赛参与者数据的研究。他们分析了参与者的解题行为与推理策略。研究揭示了团队协作和多样化方法对提升AI推理效果的关键作用。这些经验可直接应用于现有模型的优化。
事件专题

推荐理由:Nemotron Labs用5000个Kaggle实战案例总结了AI推理的改进方法,比看论文更接地气。
6月30日
22:50
22:50官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 本月在 OpenRouter 平台上处理了4.29万亿 tokens,进入该平台流量前十。开发者将其用于真实 agent 运行、编程任务和长上下文工作流。模型在处理复杂任务时表现稳定,获得社区积极反馈。

推荐理由:Step 3.7 Flash 在 OpenRouter 上月流量超4万亿 tokens,开发者拿它跑智能体、写代码,又稳又快。
16:51
16:51官方账号Decoder@Matthias Bastian
DeepSeek发布新框架DSpark,将每位用户的响应速度提升60%至85%。该框架使用小型模型生成候选token,再由大型模型批量验证。通过优化计算流程,DSpark能在更少芯片上榨取更多性能。这有助于减少中国对高端美国芯片的依赖。

推荐理由:DeepSeek的DSpark用小型模型提候选token、大模型批量验证,让速度提升85%,还减少了芯片需求,挺实用的。
13:17
13:17Geek@geekbb
精选
Qwythos 9B 基于 Qwen3.5-9B,在 5 亿 token 的 Claude 思维链轨迹上全参数微调,可处理 1M 上下文。支持原生 Function Calling 和多模态视觉(图像+文本)。GGUF 量化后仅 5.2 GiB,可在低配设备上运行。该模型为开源且未经审查。
推荐理由:Empero AI 开源的 Qwythos 9B 把 Qwen3.5 和 Claude 思维链结合,1M 上下文加 Function Calling,量化后 5.2GB 的推理模型,低配机器也能跑。
12:49
12:49官方账号阶跃星辰 Stepfun@Stepfun_AI
Step 3.7 Flash 在 Nous Portal 上获得实际应用,用户正在用它测试、构建和运行各种智能体工作流。该项目由 Nous Research 合作推进,并保持免费访问。官方邀请用户试用并分享成果。
推荐理由:快去 Nous Portal 上免费试用 Step 3.7 Flash,用它搭建各种智能体工作流,体验它的实际效果。
12:39
12:39官方一手arXiv: DeepSeek@Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou
精选
Agents-A1是一个35B参数的Mixture-of-Experts智能体模型,通过扩展智能体视野(平均轨迹长度45K tokens)达到万亿参数级别性能。它在SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和MolBench-Bind(56.8)上超越了1T参数的Kimi-K2.6和DeepSeek-V4-pro,在SciCode(44.3)、HLE(47.6)和BrowseComp(75.5)上也具有竞争力。训练采用三阶段流程:全领域SFT、领域级教师模型、多教师领域路由在线蒸馏。
推荐理由:35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。
12:27
12:27官方账号NVIDIA AI@NVIDIAAI
NVIDIA 宣布其 Nemotron 模型与 LangChain 集成,覆盖从推理到编排的智能体工作流。开发者可在开放栈上自定义、调优和部署模型。该集成面向生产环境,基于 LangChain 框架实现灵活编排。Nemotron 是 NVIDIA 的前沿智能体性能模型,支持多种部署方式。
事件专题

推荐理由:NVIDIA的Nemotron现在接入了LangChain,你可以按需调优和部署智能体,不受厂商锁定,适合做定制化AI代理。
03:06
6月29日
23:49
23:49官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
StepFun 的 Step 3.7 Flash 模型在 Claw-Eval General 基准测试中取得第二名的成绩,该基准用于评估自主智能体。模型在多步执行和长程任务鲁棒性上表现强劲,排名仅次于 Claude Opus 4.6。这一结果显示其在真实世界智能体工作负载中的潜力。

推荐理由:StepFun 的 Step 3.7 Flash 在智能体基准 Claw-Eval General 排第二,仅次于 Claude Opus 4.6,多步执行和长程任务都强,感兴趣可以看看。
15:41
13:49
13:49官方账号阶跃星辰 Stepfun@Stepfun_AI
精选
Step 3.7 Flash 是开源多模态推理模型,现已在 DeepInfra API 上线。该模型支持私有端点部署,适用于专用负载场景。它专为智能体编码、工具使用、搜索和视觉工作流设计。开发者可通过 DeepInfra 的 API 直接调用。
推荐理由:Step 3.7 Flash 开源多模态推理模型刚上线 DeepInfra,支持私有部署,适合智能体编程和视觉任务,开发者可以试试。
13:49
13:49
13:49Ethan Mollick@emollick
Ethan Mollick 指出,所有模型路由器(model routers)在处理非数学/编程任务时,普遍低估任务难度并分配过少的智能资源。他建议,对于不可验证的任务(如创新、营销、定性分析),使用更智能的模型往往能带来更大收益。这一观点源于他对多种路由器实际表现的经验观察。
推荐理由:Ethan Mollick 分享了一个容易被忽视的问题:模型路由器的任务分配不够智能,尤其对创意和分析类任务。如果你也发现一些任务结果不好,可能不是模型不行,是路由器给它派了太弱的模型。
10:11
10:11官方账号arXiv cs.AI@Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-Addad
Paper Assistant Tool(PAT)是谷歌开发的智能体框架,用于深度科学评审,能检查理论结果、验证实验并提出改进建议。PAT利用推理缩放技术,在SPOT基准上对数学错误的零样本召回率提升了34%。该工具已在STOC和ICML两大计算机科学会议作为预提交工具试点,有效识别关键错误并减轻审稿人认知负担。
推荐理由:谷歌做了个叫PAT的工具,能帮你审论文抓数学错误,召回率比普通模型高34%,已在两大顶会试过了,实用。