LoGo让模型智能决定哪些token需要全局注意力,大幅提升长文本处理效率,比传统Transformer更聪明。
MedCache解决了临床智能体如何处理跨时间、跨专科患者记录的难题,比传统方法更准确高效。
MIT团队发现机器持续遗忘中的可塑性崩溃现象,解释了为什么模型会逐渐丧失遗忘能力,甚至重新记住已删除信息。
DUOTRACE让LLM智能体故障定位更准,先检测异常再归因,准确率提升近10%。
这个AI框架能把绘画视觉特征转化为描述术语,连接图像数据与人文语义,为艺术史研究提供新工具。
LLMODE解决了LLM处理不规则时空观测的难题,通过双源门控交叉注意力将外部时空证据注入冻结LLM。
MI-Distillation解决了大模型推理轨迹蒸馏到小模型的难题,通过模型插值和SeqLSS评分提升蒸馏效果。
清华团队推出 AgenticRag-R1,解决多步推理中的检索适应性问题,比传统方法更聪明。
这个多智能体系统用知识图谱+对抗推理检测假新闻,准确率比Llama 3.3高近10%,还能自动扩充知识库。
Google Cloud上新框架,用多智能体把自然语言MLOps任务变成可验证的云部署,比传统方法更可靠。
这篇论文提出了学习系统评估的新视角,关注学习如何改变获取证据的能力,而非仅从已有证据中推断。
MIT和哈佛研究人员提出智能体技能的完整生命周期架构,解决LLM智能体在复杂任务中的可靠性瓶颈。
论文揭示了AI图像生成系统对非标准方言用户的系统性歧视,可通过重新训练减轻。
CNY让LLM自主决定何时扩展邻居获取证据,解决了传统方法静态上下文的局限,在TAG推理任务上表现更好。
SUP-MIMIC 基准测试揭示了 LLM 在临床诊断推理中的缺陷,特别是对矛盾证据的处理能力不足。
研究人员用公开数据源构建了篮球战术分析系统,能实时模拟进攻决策,接近专业队分析水平。
PhysWave统一了自然语言和轨迹控制,通过物理约束解决了现有方法违反声学关系的问题。
研究人员发布了TIDE-Bench基准,专门测试LLM在复杂对话SQL中的意图理解能力,发现现有模型在链式识别和意图漂移处理上仍有明显不足。
AGM让冻结的VLA策略变成闭环系统,物理验证子目标,机器人任务表现提升明显。
GABLE用大语言模型模拟人类行为变化,比传统移动数据预测更准,还能提前评估政策效果。
这篇论文揭示了神经网络如何通过隐式符号结构实现高性能,为理解AI工作机制提供了新视角。
Anthropic展示了AI如何学会作弊攻击系统,比普通研究更具体地展示了奖励黑客问题。
Anthropic出了篇奖励模型对齐的论文,详细讲了AI系统对齐的方法和实验结果。
Keenable AI 发布了 NEEDLE 基准,每小时更新查询集,防止搜索模型作弊跳过检索步骤。
腾讯推出ContextPilot智能体,能自主管理上下文、规划全局任务,比现有方法更高效地处理长距离任务。
Google这篇论文教你如何构建持久知识库,让智能体技能不断进化,还能迁移到更小模型上。
Google团队提出SKILL.state解决长时程智能体性能问题,准确率提升同时减少token消耗。
新论文提出用代码表示物理世界的方法,让AI能像模拟环境一样进行物理推理。
MIT新论文提出Logos框架,让AI智能体跨进程运行,故障隔离效果比单进程好80倍。
GeoNeXt用视频模型做几何估计,数据效率高,性能还超过100倍数据训练的模型。
这篇论文揭示了语音识别错误如何导致具身AI执行危险指令,并提出了评估方法。
这篇论文提出了一种新的神经算子不确定性量化方法,在达西流和纳维-斯托克斯方程实验中表现优异。
新方法让31.5B参数模型训练省1/3时间,性能还更好,适合大规模MoE模型训练。
Claude Code插件市场增长迅猛,功能提交率高,Claude参与度高,存在新型维护依赖关系。
AcrossVAM1.0通过粒子动力学显著提升机器人视频预测精度,但语言引导和外观传递仍是主要挑战。
这篇论文全面梳理了LLM智能体在安全领域的应用现状,帮你了解技术进展和未来方向。
Google推出NL2AGBench基准,测试大模型将几何问题转为AlphaGeometry形式语言的能力,闭源模型表现远超开源模型。
QGPINNs能解决量子图上的复杂微分方程,还能从噪声数据中反演分数算子阶数和物理参数,IEEE 14-bus系统测试验证了其准确性。
MIT发布了仿真就绪的肌腱驱动手Aero,包含完整训练包,无需微调即可部署。
这篇论文教你如何用合成数据提升统计推断效果,特别适合数据稀缺场景的研究者。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。