attention·general

Attention

别名
首次出现
2026-05-22
最近出现
2026-09-03
累计提及
365
§ 01综述

Attention 近期进展

  • LongCat稀疏注意力:流式感知分层跨层索引 原文标题:arXiv: DeepSeek 提出了 LongCat 稀疏注意力机制,旨在通过流式感知和分层跨层索引提高注意力机制的计算效率。
  • Gary Marcus:2017年后最大突破是模型加入工具和代码解释器 原文标题:Gary Marcus 在其社交媒体上指出,自 2017 年以来,最大的突破是模型开始加入工具和代码解释器,这一进展与注意力机制的深入应用有关。
  • 角色解耦注意力残差:按深度分离匹配与内容检索 原文标题:arXiv cs.AI 报道了一种新的角色解耦注意力残差模型,通过深度分离匹配与内容检索,提高了模型的性能。
  • CrossRAG:检索增强的多变量时间序列预测框架 原文标题:arXiv cs.AI 推出了 CrossRAG 框架,这是一个基于检索增强的多变量时间序列预测框架,其中注意力机制起到了关键作用。
  • 当前焦点与观察点

  • Fireworks AI 与 MiniMax 开源稀疏注意力内核,吞吐量提升 1.6 倍 原文标题:Fireworks AI 和 MiniMax 开源了稀疏注意力内核,显著提升了计算吞吐量。
  • Kimi K3:2.8T参数开源MoE模型,性能接近Claude Fable 5和GPT-5.6 Sol 原文标题:Kimi K3 模型,一个参数量达到 2.8T 的开源MoE模型,其性能已接近 Claude Fable 5 和 GPT-5.6 Sol。
  • Kimi K3 开源权重,2.8T MoE 模型性能提升 2.5 倍 原文标题:Kimi K3 模型的性能经过提升后,相比之前版本提升了 2.5 倍。
  • 注意力即一切:AGAO 框架实现多智能体图系统的自适应目标感知编排 原文标题:AGAO 框架通过自适应目标感知编排,实现了多智能体图系统的智能行为。
  • Variational-Ising-Attention (VIA):科学任务专用注意力机制 原文标题:VIA 是一种针对科学任务设计的注意力机制,旨在提高模型在这些特定领域的表现。
  • 每天学一个硬核AI知识点:Multi-Head Attention(多头注意力) 原文标题:多头注意力机制作为一种提高模型表示能力的方法,正在被广泛研究和应用。
  • § 02相关报道10 条在档
    1. 01
      TuringLLM推出20B参数专家混合模型
      arXiv cs.AI
    2. 02
      LoGo: Token-Level Dynamic Local-Global Attention
      arXiv cs.LG
    3. 03
      阿里Qwen团队发布Qwen3.8-Flash-Next:125B多模态MoE模型,预览Qwen4架构
      marktechpost
    4. 04
      Qwen3.8-Flash-Next在NVIDIA和AMD上运行
      阿里通义 Qwen
    5. 05
      TANGO: Token-Aggregated Nonlinear Gating Operators for Natural and Formal Language Modeling
      arXiv: Google DeepMind
    6. 06
      Prompt-Conditioned Channel Attention for Hierarchical Feature Modulation toward Anatomy-Agnostic Segmentation
      arXiv cs.AI
    7. 07
      Lévy Attention模型发布 新增连续时间不确定性预测
      arXiv cs.LG
    8. 08
      Proteus:增量记忆激活用于长上下文序列建模
      arXiv cs.LG
    9. 09
      LongCat稀疏注意力:流式感知分层跨层索引
      arXiv: DeepSeek
    10. 10
      Gary Marcus:2017年后最大突破是模型加入工具和代码解释器
      Gary Marcus
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/Attention