看这篇论文你就知道,不用微调也能高效提取临床症状。Pythia靠多智能体自己写提示词,敏感度0.76、特异度0.95,比传统词典和BERT都稳,还能本地部署。
想弄明白为啥机器人从简单奖励就能自动集群?这篇用ARM工具看到机器人内部学到的几何场,合作和对抗场景都适用。
想自动评估节奏游戏谱面生成质量?ChartGenEval用抗扰动测试给出多维反馈,比单一得分靠谱多了。
用不同尺寸纳米点组合,让储层计算在5-35°C下性能稳定,不惧温度变化。想了解新型低功耗计算硬件的人可以看看。
想了解怎么让扩散大模型跑得快?这篇综述把加速方法分了三个维度,还给了评测框架,搞推理优化的值得看。
这篇论文用因果规则和MSCR证明解决了统计模糊性问题,理论扎实,适合想深入因果AI原理的人看。
这篇论文把日常AI交互解读成神经训练,教你用观察来打断反应回路,实操感强,图像提示例子很直观。
这篇论文用实验告诉你,视觉语言模型做CoT推理时,图像其实只在开头看一次,后面全靠语言处理。想知道为什么CoT有时没用?进来看看
这篇论文提出PixelLoop,在像素级做闭环导航,比图像级方法成功率高35%以上,还能在真实机器人上跑通,值得看看。
这篇论文给固定翼无人机装上云台相机,用YOLO+UKF做跟踪,加CBF防自遮挡,最后用BPNG精准制导。整套方案仿真验证了效果,挺扎实的。
这篇论文发现44个模型在选词时高度趋同,41%都选了同一个词,而且新模型比旧模型更爱跟风。想了解AI的集体“从众心理”可以看看。
JADR协议能从模型内部直接测出危险识别能力,不用外部裁判,还能对比Qwen3和Gemma 2在不同量化下的安全表现,挺实用。
这篇论文解决了自进化AI的一个核心漏洞:没有可靠指标怎么办。他们让指标和技能一起进化,在多个基准上验证了有效性,还能防作弊。值得研究Agent自改进的人读一读。
他们挑战了多模态情感模型必须大的假设,用知识蒸馏搞出<1B的Light-MER,9个基准超了大模型还更快,做部署的可以看看。
这篇论文揭示了量子电路合成里Transformer的一个关键问题:自回归漂移让长电路精确匹配率从88%几乎归零,即使数据翻倍也只能部分缓解,值得搞量子计算和AI交叉的人看。
这论文用维度诅咒的视角,搞了个LiteTopK算子,比DeepSeek的DSA更快更省内存,GLM 5.2预填充直接快1.2倍。
这篇论文提出了一种简单的联邦强化学习聚合方法,在微电网场景下比FedAvg更安全高效,能同时提升奖励和降低违规。
这篇论文搞清了Grokking延迟的可控关键:用无标签特征族先验就能加速17倍,而且只在训练早期用一小会儿就够,比你想的简单实用。
这篇论文用Elenchos框架测了LLM的溯因推理,发现模型能发现异常但猜不准具体改了啥,挺有意思的。
这篇论文教你怎么选负荷预测模型——TFT内部做分位数学习比事后校正靠谱,区间窄5倍,适合做精确调度。
用XGBoost搞物理参数拟合,还能用SHAP解释结果,做物理AI的值得看。
这篇论文给多标签遥感域泛化提了个新思路,用标签解耦增强比全局统计强1.3个点,参数量几乎没加。
这论文搞了个叫EG-VAR的框架,用Lean内核做形式化验证,让LLM的推理结果100%可追溯,在TableBench上满分,比普通工具调用靠谱太多了。
这篇论文从GPT-2讲到对齐,批评优化文化把语言判断交给了损失函数,值得所有做AI的人反思。
想了解LLM怎么学会自我反思?这篇综述盘点了最新进展,包括怎么测量和提升元认知,对研究AI透明度很有参考。
Salesforce AI Research 发布了 E-VQA 任务和 ST-Evidence 基准,解决了视频问答无法验证视觉证据的问题。如果你想理解视频模型真正“看到”了什么,这篇论文值得一读。
想用LoRA做多模态融合?这篇用级联方式逐步整合不同模态,在医疗动作识别上效果不错,还开源了代码,可以看看。
苹果推出了MM-ToolSandBox框架,帮你测测视觉智能体到底行不行,结果很扎心:最强模型成功率不到一半,而且问题出在“看图”而不是“想事”。
这篇论文提出Requential Coding,码长不跟着模型大小和数据熵跑,比之前的方法短好几个数量级,还给十亿参数大模型给出了最牛的泛化保证。
这篇论文给出了AI怎么真正帮词典编纂者干活的具体框架,不是空谈取代,而是四个维度讲清楚怎么合作。
这篇论文用数学方法搞清楚了Transformer在归纳推理任务中怎么学习不同策略,还解释了in-context和in-weights学习谁赢跟数据统计有关,挺有启发性。
想提升音频模型对语气、情感等非语义信息的识别?试试IAAN,在不重训模型的情况下,通过对编码器内部特定神经元做微调就能显著提分,多模型实测有效。
复旦等团队用REGRIND,只看一段演示就让机械手学会用剪刀和螺丝刀,零样本上手,动作和人一样自然。
这个框架不用训练就能让AI给长视频生成连贯的旁白,特别适合帮助视障观众理解剧情。
这篇论文验证了旧的教学反馈分类协议是否还能用,发现即使用最新的LLM也不一定有优势,选什么模型看预算就行。
想知道工业界怎么搞AI可解释性需求?Daimler Truck的8位工程师实战经验,告诉你现有方法哪里不好使。
这篇论文用几何视角解释LLM评判偏见,发现偏见隐藏状态的低维子空间,还能预测模型在未知基准上的失败,挺有意思。
这篇论文不是教你怎么用AI写邮件,而是用真实实验数据告诉你:AI改写邮件语气不会直接提高回复率,但会让读邮件的人感觉更积极,从而更愿意打开和回复。
这篇论文提出了一个针对量子神经网络的新后门攻击Q-DIBA,能根据输入动态生成触发器,效果比固定触发器好,还扛得住几种常见防御。
这篇论文告诉你,不用几千GPU天也能搜出好架构,普通3060显卡3小时就能找到比ResNet-20更小的CIFAR-10模型,还能直接优化欺诈检测的F1分数。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。