7月17日
7月11日
09:43
09:43Fireworks AI@FireworksAI_HQ
精选74°
MiniMax AI发布M3内核,针对长上下文稀疏注意力中数据依赖块选择导致的内存访问瓶颈。M3采用KV-stationary设计,每个块仅读取一次。在B200 GPU上达到约980 TFLOP/s的算力。该方案有效提升长上下文推理效率。

推荐理由:MiniMax搞了个M3内核,KV-stationary让稀疏注意力在B200上跑到980 TFLOP/s,每个块只读一次,长上下文推理加速神器。
7月8日
12:19
12:19官方账号arXiv cs.AI@Anna Cordoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesus Olivera
DepthWeave-KV是一种跨层键值缓存压缩方法,通过共享低秩通道基分解相邻层状态,保留令牌特定残差。它使用令牌条件深度路由器为指令型和检索关键令牌分配更高重构秩,并通过注意力输出探头在线追踪误差自适应压缩。在LongBench等基准上,DepthWeave-KV实现近满缓存任务质量,压缩比达8.3倍,64K上下文速度72.8 tokens/s。
推荐理由:长上下文推理内存瓶颈有救了!DepthWeave-KV用跨层分解加自适应压缩,8.3倍KV缓存缩减,速度72.8 tokens/s,比其他方法效果更好。
10:31
10:31官方账号NVIDIA AI@NVIDIAAI
精选74°
NVIDIA 开源了 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 模型,总参数量 75.3B,激活参数 9.3B,采用 MoE 架构。该模型从 Nemotron-3-Super-120B 通过 Iterative Puzzle 框架压缩而来,支持 1M token 上下文长度。模型可运行在单张 GB10 显卡上。
事件专题

推荐理由:NVIDIA 刚开源的 75B MoE 模型,实际只激活 9.3B 参数,单卡就能跑百万 token 上下文,适合长文档或代码分析。
7月7日
22:15
11:21
02:58
02:58官方账号Decoder@Matthias Bastian
Zhipu AI发布ZCode开发环境,集成GLM-5.2模型,主打长上下文能力处理复杂编程任务。新客户可免费试用5天,每天最多500万token。订阅用户到2026年7月可获得约1.5倍token配额。该产品以显著低于Claude Code和OpenAI Codex的价格参与竞争,目标用户为开发者。
事件专题

推荐理由:ZCode搭载GLM-5.2,长上下文搞定复杂编码,价格只有Claude Code和Codex的零头,还送5天500万token试试水。
7月6日
11:00
11:00Geek@geekbb
精选
小红书团队开源了一个高效长上下文LLM服务框架。该框架通过注意力头分类和分段式KV缓存策略,将长上下文大模型推理的预填充FLOPs降低约50%-70%。同时保持接近无损的精度。代码已在GitHub上开源。
推荐理由:小红书开源了一个长上下文LLM推理框架,用注意力头分类和分段缓存把预填充算力省掉一半多,精度基本没损失,适合超长文本场景。
6月30日
16:05
16:05官方一手pandaily@contact@pandaily.com (Pandaily)
精选
华为开源了92B参数的openPangu-2.0-Flash模型,上下文窗口达512K tokens。该模型原生适配昇腾AI开发生态,可在Ascend硬件上高效运行。这是华为在开源大模型领域的重要动作,为开发者提供了新的选择。
事件专题

推荐理由:华为开源了92B参数的openPangu-2.0-Flash,512K上下文挺大,而且专为昇腾优化,做国产AI开发的同学可以试试。
12:48
6月29日
6月23日
6月19日
18:41
18:41官方账号Together AI@togethercompute
精选
Zai_org 推出其最新旗舰开源模型 GLM-5.2,支持 1M token 长上下文,可灵活调整推理思考力度。该模型在智能体编程任务上表现更强,现已通过 Together AI 提供推理服务,专为长上下文和工具密集型智能体工作负载优化。

推荐理由:GLM-5.2 支持百万级上下文,还能控制推理深度,搞智能体编程和复杂工具链的可以试试。Together AI 上直接用。
04:25
04:25官方账号Clement Delangue@ClementDelangue
精选
Poolside 发布了其最新模型 Laguna M.1,拥有 256K 上下文长度。该模型采用 Apache 2.0 许可,权重已开放至 Hugging Face。包括基础版和微调版检查点可供下载。
事件专题

推荐理由:Poolside 把最强的 Laguna M.1 模型完全开放了,256K 上下文,Apache 2.0 许可,直接去 Hugging Face 下载权重用。
6月17日
23:06
23:06官方账号LMSYS Org (SGLang)@lmsysorg
精选
Zai_org 发布了新旗舰模型 GLM-5.2,支持 1M token 长上下文。在 Terminal-Bench 2.1 上,GLM-5.2 得分 81.0,相比 GLM-5.1 的 62.0 提升明显。IndexShare 机制在 1M 上下文下将每 token 的 FLOPs 降低了 2.9 倍,改进的 MTP 将投机解码接受率提升了 20%。该模型在 SGLang 中已获得即日支持。

推荐理由:Zai_org 的 GLM-5.2 来了,1M 长上下文拿下了 81.0 的 Terminal-Bench 分数,比上一代高出一截,而且推理效率也优化了,值得上手试试。
11:36
11:36量子位@十三
智谱AI于2026年6月开源了GLM-5.2模型,支持1M上下文长度。该模型在AI编程评测基准上取得第一,超过此前领先的Fable-5。基于GLM架构的持续优化,GLM-5.2在代码生成任务中展现出更强能力。开源版本已发布在GitHub。
事件专题

推荐理由:智谱开源了GLM-5.2,1M超长上下文,编程能力直接拿下第一,想换编程模型的话可以试试。
04:01
6月12日
22:52
22:52官方账号NVIDIA AI@NVIDIAAI
MiniMax 团队发布了 MiniMax M3,这是一个支持文本、图像和视频推理的长上下文多模态模型。模型采用稀疏注意力机制,总参数量约 428B,激活参数仅约 23B,在保持高性能的同时大幅降低了计算成本。该模型已开源权重,可在 Hugging Face 获取,并可通过 NVIDIA 的 GPU 加速端点免费试用。M3 的长上下文能力使其在处理视频、长文档等场景中具有优势。
事件专题

推荐理由:多模态推理模型终于有了高效的开源选择——MiniMax M3 用 23B 激活参数实现长上下文多模态推理,做视频分析或长文档处理的团队可以直接在 NVIDIA 端点免费试,值得关注。
6月10日