这篇论文实测了华为昇腾跑MoE和多模态大模型的工程代价——需要打12个补丁、关掉一堆特性才能不出错,想用非GPU加速器的团队先看看这个。
想评估AI在真实物理系统中的可信度?这个新基准从六个维度测试智能体,还带了LLM审计层,结果挺扎心:RL优化收益但会钻物理漏洞。
想找能同时把深挖和广搜做到极致的搜索方法?看WebSwarm怎么用递归多智能体搞定的,测试结果比单智能体强不少。
这篇论文用DeepSeek-V3模拟了18个AI代理的市场,发现加入调解机制能抗住攻击,效用只降13%但市场不会崩盘。
想解决机器人奖励函数跨环境失效的问题?这篇论文给出了数学分析和一种更聪明的教学策略,用更少反馈让奖励更鲁棒。
UltraX 搞了个新框架,用程序化编辑替代传统规则和LLM方式,既能细粒度编辑又保证效率,精炼预训练数据效果不错。
别只看用理想病人测AI的论文,这篇用2053个真实对话发现,交流风格直接改变分诊结果,准确率才55%!
这篇论文提的S^2AE让视觉语言模型里稀疏编码的概念更一致,比普通SAE语义对齐涨了6%,还能保持高重建质量。搞多模态可解释性的可以看看。
这篇论文提出了 Jailbreak,用 LLM 直接读数据库存储文件,不用 JDBC,TPC-H 测试下最高快 27 倍。搞大数据分析的人可以看看。
这篇论文拿多个模型种群跑了几万局游戏,发现换一条规则,事故率能差 58 个百分点,而且匿名化也挡不住针对性消除。做多智能体安全的一定要看。
想做靠谱的自主AI代理?SkillCenter 给了21万+带原始出处的技能,从论文到代码全有,还能离线搜。
这篇论文挖出了LLM理解方言但生成不了方言的深层矛盾,还对比了多种对齐方法,结果很反直觉。
这篇论文把AI自我改进的各种文献梳理得特别清楚,区分了“有界自优化”和真正的“递归自我改进”,还画出了验证强度层级,读完对AI安全风险理解更深。
这篇论文把EffiBench、EvalPerf等流行代码性能基准的漏洞全翻出来了——1538个任务里只有6%能真正测出差异。他们搞了个多智能体框架自动生成更刁钻的测试,效果直接翻四倍。
这篇论文拆穿了多智能体安全评估的常见错觉——GPT看似安全但只是被拒绝掩盖,Gemini配对Claude反而危险。做安全测试时别只看总数。
这篇论文搞清楚了Transformer线性化为什么delta式更厉害,还给出了具体修补方案,在LLaMA和Qwen上跑到了32B,MMLU成绩比之前的后验方法好。
这篇论文教你怎么用更少的反馈数据训练扩散模型,关键是把去噪步和样本按重要性加权,实验涨了6倍效率。
Agon让两个模型互相打分比赛,推理能力直接翻倍,比GRPO强一倍,而且完全不需要人工标注过程标签。
用手机拍张纸质心电图,ECGLight直接在本地CPU跑30秒就能筛查心梗,准确率95%以上,偏远地区也能用。
这篇论文搞了个叫NOTES的框架,用神经算子压缩设计空间,再用进化策略找最优,在纳米光子偏转器上效率超95%,比传统方法好。
这篇论文提出了一个统一的采样框架,帮你理解模型在不同大小输入上的泛化能力,还能把大输入压缩成小输入来节省计算,例子涵盖Transformer和图神经网络。
这篇论文解释了为什么RoPE在训练中某些频率更常用,还教你用频率缩放来扛更长上下文,很实用。
这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。
不想重训练模型?PeTeR这个后训练方法不用数据就能给概率电路加固,效果和从头做鲁棒训练差不多。
这篇论文发现Bielik模型内部激活能提前判断它是否熟悉某个实体,但模型几乎不会拒绝回答,事实准确性随规模增长明显。对理解大模型胡说八道的原因很有启发。
这篇论文找到了CFG在高引导下翻车的数学原因,还给了个零成本修复,CIFAR-10和SD1.5上点FID全胜,做采样的人值得看看。
这篇论文搞了个新路子,用误差估计自动告诉你该在网络的哪一层加更多神经元,在流体力学数据上比现有方法都强。
这篇论文提出RNC-LM,解决了LM方法在强曲率问题上的局限,用黎曼法坐标做高阶修正,在PINN和势能面拟合上又准又快。
这篇论文用一个改进的损失函数让药物相互作用预测准了将近20个百分点,读来很有启发。
这篇论文用三种BERT模型对比了多类和多标签的漏洞分类效果,发现错误更多来自CWE层次结构而非模型选择,对安全领域做文本分类的人很有参考价值。
开源模型DeepSeek V3.2套上智能体架构,在ARC推理任务上以不到1美元成本拿下67%准确率,比零样本强了50多个点,硬件开销很低。
别盲目跑网格搜索了。这篇论文提出Floor-First方法,用资源向量估算性能下限,在DeepSeek-V3.2上验证了不同注意力布局的容量墙差异,帮你理性选部署方案。
这篇论文用可控实验证明了RL后训练能从头组合出高级推理策略,不是只增强已有技能,对理解强化学习训练机制很有启发。
一篇用QCNN和路径签名核搞定时间序列分类的新论文,手写数字分类实验证明了量子电路里加签名核的有效性,适合关注量子机器学习的朋友。
这篇论文提出了一种新方法,可以在模型回答之前就预测它的置信度,比传统方法更准更省计算成本。
这篇论文梳理了Agentic AI的特殊治理挑战,如果你关心AI安全和伦理,值得一看。
这篇论文提出CARLA-GS,用多智能体LLM做推理、PID控制确保物理可行,在Waymo数据上生成逼真角落场景,解决了端到端方法时空不一致的痛点。
这篇论文提出了FedKT-CSD,通过预训练自编码器生成合成数据,同时提供差分隐私保护,在异质性数据下性能不输无隐私方法。
这篇研究说AI一味追求“省事”反而帮倒忙——结构设计需要“摩擦”来激发灵感。他们用视觉语言模型做了个交互系统,帮设计师边想边改,保留思考摩擦,去掉重复劳动。
这篇论文从理论上分析了图信号生成流模型的结构扰动稳定性,还给了个实用的正则化训练方法,在fMRI等真实数据上验证有效。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。