05:54elvis@omarsar072°Kimi发布K3开源模型,拥有2.8万亿参数、100万上下文窗口和原生多模态能力。K3采用Kimi Delta Attention,在百万token上下文中实现解码速度提升6.3倍。Attention Residuals机制以不到2%的额外成本带来约25%的训练效率提升。该模型面向长程智能体编程和自演进工作流设计,开源权重计划于2026年7月27日开放。AI模型Kimi K3Moonshot AI开源模型10 个信源在谈事件专题推荐理由:Kimi新开源模型K3,参数2.8万亿,能处理百万上下文,速度还快了6倍多,做长程智能体任务很合适。原文稍后读已读值得跟进有用关注 Kimi K3
05:00lmarena.ai@lmarena_ai精选76°Kimi K3在Text Arena以1486分排名第9,较Kimi K2.6的38名跃升29位。该模型在创意写作、编程和指令遵循三个子项进入前十,并在物理与社会科学、法律与政府、医学与医疗三个职业领域排名第一。Kimi K3拥有2.8万亿参数和100万上下文窗口,其Delta注意力机制使百万token上下文的解码速度提升6.3倍,Attention Residuals在不到2%额外成本下实现约25%训练效率提升。完整模型权重将于2025年7月27日开源。AI模型Kimi-K3KimiMoonshot10 个信源在谈事件专题推荐理由:Kimi发了K3,2.8万亿参数,Text Arena排名比上代涨了29位,代码和创意写作都进前十,权重7月开源值得关注。原文稍后读已读值得跟进有用关注 Kimi-K3
04:54AI SDK@aisdk76°Moonshot推出Kimi K3模型,拥有2.8万亿参数和100万上下文窗口,支持原生多模态。采用Kimi Delta Attention技术,百万token上下文解码速度提升至6.3倍。Attention Residuals机制实现约25%更高训练效率,成本仅增加不到2%。模型已上线Kimi.com、Kimi Work、Kimi Code及Kimi API,计划2026年7月27日开源权重。AI模型MoonshotKimi K3推理模型10 个信源在谈事件专题推荐理由:Kimi K3参数2.8万亿,百万上下文,解码快6.3倍,适合长任务编程,赶紧试试。原文稍后读已读值得跟进有用关注 Moonshot
04:13lmarena.ai@lmarena_ai精选74°Kimi K3拥有2.8万亿参数和100万token上下文窗口,采用Kimi Delta Attention技术,在百万token上下文中解码速度提升最多6.3倍。Attention Residuals技术以不到2%的额外成本实现约25%更高的训练效率。该模型专注于长时智能体编码和自演进工作流,已在Kimi.com等平台上线,开放权重将于2026年7月27日发布。AI模型Kimi K3Kimi长上下文10 个信源在谈事件专题推荐理由:月之暗面刚发Kimi K3,2.8万亿参数能处理百万上下文,解码快6倍多,适合搞长代码项目。原文稍后读已读值得跟进有用关注 Kimi K3
09:43Fireworks AI@FireworksAI_HQ精选74°MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。AI模型MiniMaxM3Blackwell推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。原文稍后读已读值得跟进有用关注 MiniMax
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus OliveraDepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。论文DepthWeave-KVKV缓存压缩长上下文推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。原文稍后读已读值得跟进有用关注 DepthWeave-KV
12:17官方账号arXiv cs.AI@Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús OliveraFreqDepthKV是一种推理时KV缓存压缩方法,通过将相邻层的KV状态分解为共享低频深度分量和稀疏高频残差,并利用轻量在线探测根据注意力头对重建的贡献分配缓存模式。在32k token预填窗口下,FreqDepthKV在长上下文问答、检索、摘要和代码生成任务上达到58.3 Exact Match、63.0 F1、32.5 ROUGE-L和48.1 pass@1,接近全KV缓存水平。它还将解码吞吐提升至70.4 tokens/s,首令牌延迟降至2.06秒,峰值KV内存降至6.2 GB,实现3.9倍有效压缩比。AI模型FreqDepthKVKV缓存压缩长上下文推荐理由:FreqDepthKV在长上下文推理中将KV缓存压缩3.9倍,同时保持任务精度,比此前压缩方法更稳定,适合内存受限场景。原文稍后读已读值得跟进有用关注 FreqDepthKV
10:31官方账号NVIDIA AI@NVIDIAAI精选74°NVIDIA 开源了 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 模型,总参数量 75.3B,激活参数 9.3B,采用 MoE 架构。该模型从 Nemotron-3-Super-120B 通过 Iterative Puzzle 框架压缩而来,支持 1M token 上下文长度。模型可运行在单张 GB10 显卡上。AI模型NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4NVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA 刚开源的 75B MoE 模型,实际只激活 9.3B 参数,单卡就能跑百万 token 上下文,适合长文档或代码分析。原文稍后读已读值得跟进有用关注 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4
22:15elvis@omarsar0精选MiniMax M3 是一款支持多模态的长运行智能体模型。它采用稀疏注意力机制,有效降低长上下文下的计算开销。该模型可同时处理文本与图像等多种输入。其设计使智能体在长时间任务中保持高效实用。AI模型MiniMax M3多模态智能体推荐理由:MiniMax M3 用稀疏注意力让智能体能跑很久,多模态还实用,搞长任务的不妨关注一下。原文稍后读已读值得跟进有用关注 MiniMax M3
11:21官方账号Nous Research@NousResearch精选腾讯混元发布新模型Hy3,参数量295B,采用MoE架构。Hy3在Nous Portal上免费开放两周。该模型专注于低成本智能体应用,在编码、工具调用可靠性、推理以及256K长上下文任务上表现突出。AI模型Hy3腾讯混元MoE推荐理由:腾讯混元这个Hy3模型挺牛的,295B参数还免费玩两周,编码和工具调用都很强,值得试试。原文稍后读已读值得跟进有用关注 Hy3
02:58官方账号Decoder@Matthias BastianZhipu AI发布ZCode开发环境,集成GLM-5.2模型,主打长上下文能力处理复杂编程任务。新客户可免费试用5天,每天最多500万token。订阅用户到2026年7月可获得约1.5倍token配额。该产品以显著低于Claude Code和OpenAI Codex的价格参与竞争,目标用户为开发者。AI产品ZCodeGLM-5.2Zhipu AI10 个信源在谈事件专题推荐理由:ZCode搭载GLM-5.2,长上下文搞定复杂编码,价格只有Claude Code和Codex的零头,还送5天500万token试试水。原文稍后读已读值得跟进有用关注 ZCode
11:00Geek@geekbb精选小红书团队开源了一个高效长上下文LLM服务框架。该框架通过注意力头分类和分段式KV缓存策略,将长上下文大模型推理的预填充FLOPs降低约50%-70%。同时保持接近无损的精度。代码已在GitHub上开源。AI模型小红书长上下文LLM推理推荐理由:小红书开源了一个长上下文LLM推理框架,用注意力头分类和分段缓存把预填充算力省掉一半多,精度基本没损失,适合超长文本场景。原文稍后读已读值得跟进有用关注 小红书
10:03官方账号arXiv cs.AI@Wanyun Cui精选HOLA 为线性注意力模型引入一个专用的精确 KV 缓存作为海马体补丁,与原有的压缩状态共同形成半参数化记忆。在 340M 参数、15B SlimPajama tokens 训练下,HOLA 将 Wikitext 困惑度从 27.32 降至 22.92(-16.1%),甚至低于完整注意力 Transformer++(26.88);LAMBADA 困惑度从 30.95 降至 30.26。在 RULER 的 needle-in-a-haystack 召回任务中,HOLA 在 32k tokens(16 倍训练长度)下仍保持稳健,优于 GDN 和同类缓存方法。论文HOLA线性注意力海马体1 个信源在谈事件专题推荐理由:线性注意力模型容易忘事?HOLA 加了个小型精确缓存,长上下文检索比全注意力还强。原文稍后读已读值得跟进有用关注 HOLA
09:43官方账号arXiv cs.LG@Wenhao Li, Jinhao Dong, Hailin Zhang, Wenhang Shi, Wei Lu, Xiaoyong DuRaBitQCache利用随机旋转二进制量化和二进制INT4算术高效估计注意力权重。该方法的代理分数是无偏估计量且具有可证误差界,支持自适应Top-p检索动态调整令牌预算。硬件感知系统通过异步流水线和惰性更新隐藏开销。实验表明,相比现有基线,RaBitQCache显著加速推理并减少内存I/O,同时保持生成质量。代码已在GitHub开源。论文RaBitQCache旋转二进制量化KV缓存推荐理由:RaBitQCache用旋转二进制量化KV缓存,比现有稀疏注意力方法更快更省内存,还能自适应调整预算。原文稍后读已读值得跟进有用关注 RaBitQCache
16:05官方一手pandaily@contact@pandaily.com (Pandaily)精选华为开源了92B参数的openPangu-2.0-Flash模型,上下文窗口达512K tokens。该模型原生适配昇腾AI开发生态,可在Ascend硬件上高效运行。这是华为在开源大模型领域的重要动作,为开发者提供了新的选择。AI模型openPangu-2.0-FlashHuaweiAscend1 个信源在谈事件专题推荐理由:华为开源了92B参数的openPangu-2.0-Flash,512K上下文挺大,而且专为昇腾优化,做国产AI开发的同学可以试试。原文稍后读已读值得跟进有用关注 openPangu-2.0-Flash
12:48官方账号Microsoft Research@MSFTResearchAI代理无法记忆历史对话,随任务变长效率下降。微软研究院推出Memora,一种可扩展记忆系统。它将存储内容与检索方式分离,解决长上下文效率问题。AI模型智能体记忆系统长上下文推荐理由:微软出了个叫Memora的记忆系统,让AI能记住长对话不卡顿,比硬加载上下文聪明多了。原文稍后读已读值得跟进有用关注 智能体
13:49官方账号Together AI@togethercomputeGLM-5.2模型已在Together AI平台上架,并通过OpenRouter快速提供服务。Together AI优化推理路径,使模型在长上下文编码和智能体工作负载中每GPU能处理更多token,同时保持低延迟。该模型展现出强劲性能,适合需要高吞吐的复杂任务。AI模型GLM-5.2Together AIOpenRouter1 个信源在谈事件专题推荐理由:GLM-5.2跑得快,长上下文和智能体场景下Together的优化让token更多更流畅,试试看。原文稍后读已读值得跟进有用关注 GLM-5.2
09:43官方一手arXiv: DeepSeek@Fengfeng Liang, Yuechen Zhang, Jiaya Jia精选Block-GTQ是一种针对RoPE注意力机制的KV缓存量化位分配方法,基于TurboQuant-MSE构建。它在每个层和注意力头上计算RoPE块的能量得分,通过贪心分配整数位宽。在2和3比特每维度仅量化键的实验中,Block-GTQ在10个模型上使每层平均绝对误差降低32-80%,并赢得全部367个层比较。在Llama-3.1-8B-Instruct上以K2V2配置,NIAH六任务平均从70.6提升至97.4,LongBench英文平均从36.87提升至53.31。在DeepSeek-R1-Distill-Qwen-7B上以K3V2配置,AIME 2024/2025得分51.7/37.5,接近fp16的54.2/37.9,而均匀量化降为0.0/0.0。在H800上对Qwen2.5-3B-Instruct实现3.24倍压缩,128K上下文比fp16 FlashAttention2快1.34倍,峰值内存从56.31GB降至19.85GB。论文Block-GTQRoPEKV缓存量化推荐理由:这篇论文用RoPE感知的位分配方案,在KV缓存量化上显著提升长上下文检索和推理,效果逼平fp16,值得研究量化的朋友细读。原文稍后读已读值得跟进有用关注 Block-GTQ
14:40官方一手marktechpost@Sana Hassan精选71°本文通过GLM-5.2的OpenAI兼容API搭建了完整工作流,包括安全加载API密钥和创建可复用聊天封装。演示了思考努力控制、流式推理、函数调用以及工具使用代理的实现。还展示了结构化JSON输出和长上下文检索功能,并记录了token消耗与成本核算。技巧GLM-5.2推理模型函数调用8 个信源在谈事件专题推荐理由:这篇教程手把手教你用GLM-5.2 API实现推理控制、函数调用和检索,代码可直接复用。原文稍后读已读值得跟进有用关注 GLM-5.2
18:41官方账号Together AI@togethercompute精选Zai_org 推出其最新旗舰开源模型 GLM-5.2,支持 1M token 长上下文,可灵活调整推理思考力度。该模型在智能体编程任务上表现更强,现已通过 Together AI 提供推理服务,专为长上下文和工具密集型智能体工作负载优化。AI模型GLM-5.2Zai_orgTogether AI推荐理由:GLM-5.2 支持百万级上下文,还能控制推理深度,搞智能体编程和复杂工具链的可以试试。Together AI 上直接用。原文稍后读已读值得跟进有用关注 GLM-5.2
04:25官方账号Clement Delangue@ClementDelangue精选Poolside 发布了其最新模型 Laguna M.1,拥有 256K 上下文长度。该模型采用 Apache 2.0 许可,权重已开放至 Hugging Face。包括基础版和微调版检查点可供下载。AI模型PoolsideLaguna M.1Hugging Face2 个信源在谈事件专题推荐理由:Poolside 把最强的 Laguna M.1 模型完全开放了,256K 上下文,Apache 2.0 许可,直接去 Hugging Face 下载权重用。原文稍后读已读值得跟进有用关注 Poolside
23:33官方一手marktechpost@Asif Razzaq精选MiniMax 发布 Sparse Attention (MSA) 机制,基于 Grouped Query Attention (GQA) 架构。MSA 包含一个轻量级索引分支,为每个查询和 GQA 组选择 Top-k 键值块;主分支仅关注这些块。在 1M 上下文长度下,每个 token 的注意力计算量减少 28.4 倍。该机制训练在 109B 参数的 MoE 模型上,使用 3T token 预算,下游基准测试中与 GQA 性能相当。AI模型MiniMaxMSA稀疏注意力推荐理由:MiniMax 搞了个新稀疏注意力 MSA,1M 上下文计算量降 28 倍,准度却一点没掉,适合长文本场景。原文稍后读已读值得跟进有用关注 MiniMax
23:06官方账号LMSYS Org (SGLang)@lmsysorg精选Zai_org 发布了新旗舰模型 GLM-5.2,支持 1M token 长上下文。在 Terminal-Bench 2.1 上,GLM-5.2 得分 81.0,相比 GLM-5.1 的 62.0 提升明显。IndexShare 机制在 1M 上下文下将每 token 的 FLOPs 降低了 2.9 倍,改进的 MTP 将投机解码接受率提升了 20%。该模型在 SGLang 中已获得即日支持。AI模型GLM-5.2Zai_orgSGLang推荐理由:Zai_org 的 GLM-5.2 来了,1M 长上下文拿下了 81.0 的 Terminal-Bench 分数,比上一代高出一截,而且推理效率也优化了,值得上手试试。原文稍后读已读值得跟进有用关注 GLM-5.2
11:55官方一手歸藏(guizang.ai)@op741874°智谱 AI 正式发布并开源 GLM-5.2 模型。该模型支持 100 万 token 稳定上下文,并引入思考力度控制能力。架构上采用 IndexShare 机制,每四层稀疏注意力共享 indexer,在百万 token 下将每 token 计算量降低约 2.9 倍。基准测试成绩表现出色,定位处理长周期任务。AI模型GLM-5.2智谱开源模型推荐理由:智谱 GLM-5.2 开源了,百万上下文还能省 2.9 倍算力,做长任务的朋友可以上手试试。原文稍后读已读值得跟进有用关注 GLM-5.2
11:36量子位@十三智谱AI于2026年6月开源了GLM-5.2模型,支持1M上下文长度。该模型在AI编程评测基准上取得第一,超过此前领先的Fable-5。基于GLM架构的持续优化,GLM-5.2在代码生成任务中展现出更强能力。开源版本已发布在GitHub。AI模型GLM-5.2智谱编程助手10 个信源在谈事件专题推荐理由:智谱开源了GLM-5.2,1M超长上下文,编程能力直接拿下第一,想换编程模型的话可以试试。原文稍后读已读值得跟进有用关注 GLM-5.2
08:45berryxia@berryxiaGLM-5.2 以 MIT 协议免费开源,提供 1M 上下文窗口,重点强化了长程任务的 Agent 能力。在 Coding、Tool use、Reasoning 上相比 GLM-5.1 有明显进步,尤其在需要长时间规划和多步执行的场景。API 价格不变,同时支持 Max 和 High 两种推理模式。社区已在 DeepSWE 等基准上验证其实力,开发者可在本地运行长上下文 Agent。AI模型GLM-5.2开源模型智能体推荐理由:智谱开源了GLM-5.2,MIT协议、1M上下文,编程和Agent任务比上一代强不少,还能本地跑,别错过。原文稍后读已读值得跟进有用关注 GLM-5.2
04:01elvis@omarsar072°Z.ai 宣布推出 GLM-5.2 开源权重模型,MIT 许可发布。其在编码和智能体任务上有显著改进,支持 1M 上下文窗口。提供两种推理等级:GLM-5.2 (max) 和 GLM-5.2 (high),后者在性能与 token 效率间取得平衡。API 定价与 GLM-5.1 相同,权重已上架 Hugging Face。AI模型GLM-5.2Z.ai开源模型推荐理由:Z.ai 发了 GLM-5.2,开源权重、MIT 许可,编码和智能体能力提升明显,还支持 1M 上下文,想玩前沿模型的可以试试。原文稍后读已读值得跟进有用关注 GLM-5.2
03:49ollama@ollama精选Z.ai 发布 GLM-5.2,支持 1M token 上下文窗口,专为长程编码和智能体任务设计。提供两种推理模式:GLM-5.2 (max) 和 GLM-5.2 (high),权重以 MIT 许可开源。现已通过 Ollama 云服务在美国 NVIDIA Blackwell GPU 上可用,API 定价与 GLM-5.1 相同。该模型声称是目前最强开源编码模型。AI模型GLM-5.2Z.aiOllama10 个信源在谈事件专题推荐理由:Z.ai 开源了 GLM-5.2,有 1M 上下文窗口,适合写长代码和搭智能体,在 Ollama 上直接就能用,MIT 许可随便玩。原文稍后读已读值得跟进有用关注 GLM-5.2
02:17kimmonismus@kimmonismus77°GLM-5.2 以 MIT 许可证开源,权重开放。该模型支持 1M token 上下文窗口。提供 max 和 high 两种推理模式。专门针对大规模部署、自动化研究、性能优化和复杂调试进行训练。API 定价与 GLM-5.1 保持一致。AI模型GLM-5.2智谱开源模型推荐理由:智谱开源了 GLM-5.2,1M 上下文还能选推理模式,做长代码任务更强了。原文稍后读已读值得跟进有用关注 GLM-5.2
12:23官方账号arXiv cs.LG@Mufei Li, Shikun Liu, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan LiKVEraser是一种面向大语言模型KV缓存的编辑方法,旨在高效擦除已处理上下文中的指定片段。该论文提出,直接擦除会导致全局影响,需重新计算后续所有token,成本高昂。KVEraser通过两阶段训练(通用跨度-邻居预训练和任务微调),仅替换被擦除区间的KV状态,保留其余缓存。在1K至32K上下文长度的域内任务中,KVEraser的擦除后性能接近完全重计算,延迟仅增加24%,而完全重计算延迟增加17.6倍。在未见过的长文档问答任务中,KVEraser在有害事实干扰下比近似基线表现更好,速度比完全重计算快3至4倍。论文KVEraserKV缓存上下文擦除推荐理由:这篇论文提出KVEraser,能快速从大模型KV缓存中擦除指定内容,不用全部重算,1K-32K长度下延迟只增24%,效果接近重算,适合长上下文场景。原文稍后读已读值得跟进有用关注 KVEraser
14:13官方一手marktechpost@Michal Sutter79°Z.ai 于 2026 年 6 月 13 日发布 GLM-5.2,覆盖所有 GLM Coding Plan 层级。该模型支持 100 万 token 的可用上下文窗口,并提供 High 和 Max 两种思考努力级别。GLM-5.2 通过 Anthropic 兼容端点集成到 Claude Code、Cline 和 OpenClaw 等工具中。发布时未公布基准测试结果,MIT 开源权重预计下周发布。AI模型Z.aiGLM-5.2长上下文10 个信源在谈事件专题推荐理由:Z.ai 的 GLM-5.2 支持百万token上下文,还能选思考深度原文稍后读已读值得跟进有用关注 Z.ai
16:18官方一手Pandaily@contact@pandaily.com (Pandaily)72°智谱AI宣布将GLM-5.2模型以MIT许可证开源,支持100万token上下文长度。此举直接回应美国针对Anthropic模型的出口限制。GLM-5.2在多项基准测试中表现优异,其开源策略旨在推动国内AI生态发展。AI模型GLM-5.2Zhipu AI开源模型10 个信源在谈事件专题推荐理由:智谱开源百万token模型原文稍后读已读值得跟进有用关注 GLM-5.2
22:52官方账号NVIDIA AI@NVIDIAAIMiniMax 团队发布了 MiniMax M3,这是一个支持文本、图像和视频推理的长上下文多模态模型。模型采用稀疏注意力机制,总参数量约 428B,激活参数仅约 23B,在保持高性能的同时大幅降低了计算成本。该模型已开源权重,可在 Hugging Face 获取,并可通过 NVIDIA 的 GPU 加速端点免费试用。M3 的长上下文能力使其在处理视频、长文档等场景中具有优势。AI模型MiniMaxM3多模态模型10 个信源在谈事件专题推荐理由:多模态推理模型终于有了高效的开源选择——MiniMax M3 用 23B 激活参数实现长上下文多模态推理,做视频分析或长文档处理的团队可以直接在 NVIDIA 端点免费试,值得关注。原文稍后读已读值得跟进有用关注 MiniMax
12:32karminski-牙医 (AI工具)@karminski3精选FlashMemory 论文提出一种神经内存索引器,能将 DeepSeekV4 的 1M 上下文显存占用从约 10GB 压缩至 1.3GB,且输出准确率反而提升 0.6%。该方法通过预测未来需要的历史片段,按需加载 KVCache,实现注意力降噪。索引器采用解耦训练,无需加载基座模型,训练成本大幅降低。该技术对长文本推理场景具有重大意义,尤其适合资源受限的部署环境。论文FlashMemoryDeepSeekV4显存优化推荐理由:长文本推理的显存瓶颈被 FlashMemory 大幅缓解,做 LLM 推理优化或部署长上下文模型的团队可以直接参考论文方法,效果甚至比原版更好。原文稍后读已读值得跟进有用关注 FlashMemory
09:13官方账号arXiv cs.AI@Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Pengyu Zhao精选MiniMax 提出了一种名为 MiniMax Sparse Attention (MSA) 的块级稀疏注意力机制,旨在解决大语言模型在超长上下文(百万级 token)下的计算瓶颈。MSA 基于分组查询注意力(GQA),通过轻量级索引分支对键值块进行评分,并为每个 GQA 组独立选择 Top-k 子集,实现高效的组级稀疏检索。在 109B 参数的多模态模型上,MSA 在 1M 上下文长度下将每 token 注意力计算量减少 28.4 倍,并在 H800 GPU 上实现 14.2 倍预填充和 7.6 倍解码加速。该方法的推理内核已开源,同时发布了基于 MSA 的生产级多模态模型。论文稀疏注意力长上下文推理加速推荐理由:做长上下文推理或 agent 工作流的开发者,终于有了一个能直接部署的稀疏注意力方案——MSA 在 109B 模型上实现 28 倍计算缩减,且内核已开源,值得立刻试跑。原文稍后读已读值得跟进有用关注 稀疏注意力
07:01官方账号Together AI@togethercompute精选Together AI 团队提出 Untied Ulysses 方法,解决了长上下文训练中的显存瓶颈。传统方法在单节点 8xH100 上训练 Llama 3B 模型时,仅模型参数就会耗尽显存,无法支持 3M token 的上下文长度。新方法通过优化注意力机制,在 8B 和 32B 规模下实现了比先前实现长 25% 的序列训练。这项研究让大模型长上下文训练变得更可行,降低了硬件门槛。论文长上下文显存优化注意力机制推荐理由:长上下文训练一直是显存大户,Untied Ulysses 让单节点就能跑 3M token,做 LLM 训练和推理优化的团队值得关注,能省下不少 GPU 预算。原文稍后读已读值得跟进有用关注 长上下文
00:24官方账号SiliconFlowAI@siliconflowai精选Google DeepMind 的 Gemma 4 12B 模型已在 SiliconFlow 平台上线,支持 262K 上下文、内置思考、原生工具调用及 140+ 语言。该模型采用无编码器架构,视觉和音频输入直接进入 LLM 主干,降低处理延迟。12B 参数规模但拥有 26B 的“大脑”性能,接近 Google 26B 模型的表现,在多步推理和智能体工作流中表现出色。定价为输入/输出每百万 tokens 0.1/0.3 美元,性价比突出。AI模型Gemma 4智能体多模态7 个信源在谈事件专题推荐理由:做智能体、长上下文或多模态应用的开发者终于有了一个模型搞定三件事的选择——Gemma 4 12B 在 SiliconFlow 上价格亲民,建议直接上手试试。原文稍后读已读值得跟进有用关注 Gemma 4
12:57AI Will@FinanceYF588°Anthropic 的 Claude 5 Fable 模型在 Stripe 的 5000 万行 Ruby 代码库迁移任务中表现出色,将原本需要整支团队耗时两个月的工作压缩至一天完成。该模型在长任务和复杂场景下优势显著,效率、上下文管理能力全面升级,且 token 使用更高效。测试显示,任务越长越复杂,Fable 5 与其他模型的差距越大。这一成果标志着 AI 在大型代码库工程任务中的实用价值迈上新台阶。AI产品Claude 5 Fable代码迁移长上下文10 个信源在谈事件专题推荐理由:大型代码库迁移是工程团队的噩梦,Fable 5 把两个月压缩成一天,做后端或基础设施的开发者值得关注——这可能是你未来省下整支团队时间的关键工具。原文稍后读已读值得跟进有用关注 Claude 5 Fable
12:12官方账号arXiv cs.LG@Albert Gong, Annabelle Michael Carrell, Raaz Dwivedi, Lester Mackey精选研究人员提出了一种名为 Express 的新工具,能将非因果注意力近似转换为因果注意力近似,并保持相同的近似保证。结合最先进的 Thinformer 近似,Express 在因果注意力上实现了已知最佳近似误差,仅需 O(s) 内存和 O(s² log²(n)) 压缩开销。该工具通过高效的 I/O 感知 Triton 实现,在长上下文预填充、KV 缓存压缩、长序列解码等场景中显著超越 FlashAttention 2。这解决了语言模型在长序列处理中的四个关键资源瓶颈。论文注意力近似因果注意力长上下文推荐理由:做长上下文语言模型推理优化的团队,Express 能同时提升预填充和解码效率,值得直接集成到现有流水线中。原文稍后读已读值得跟进有用关注 注意力近似
08:12官方账号Simon Willison’s Weblog(博客/媒体)88°Simon Willison 在 Claude Fable 5 发布后第一时间进行了约 5.5 小时的测试。该模型与 Claude Mythos 5 性能相同,但增加了严格的安全护栏,触发时 API 会通知用户并可自动回退到其他模型。Fable 5 拥有 100 万 token 上下文窗口、12.8 万最大输出 token,知识截止于 2026 年 1 月,价格是 Opus 4.8 的两倍。Willison 认为它“感觉很大”,不仅体现在速度和成本上,更在于其知识深度,例如能准确列出他的开源项目。当前挑战已从“模型能做什么”转向“找到它做不了的事”。AI模型Claude Fable 5Claude Mythos 5安全护栏10 个信源在谈事件专题推荐理由:Claude Fable 5 的“大模型感”让开发者重新思考任务边界——如果你经常用 Claude 处理复杂推理或长上下文任务,这个模型值得一试,但要做好预算准备。原文稍后读已读值得跟进有用关注 Claude Fable 5