这篇论文换了个思路:别死磕条件独立性检验,用干预信息直接做因果发现,还放宽了忠实性假设,挺颠覆的。
这篇论文发了一个能识别跨周对话诈骗的系统,在公开数据集上准确率接近98%,还有用户研究证明它真的管用。
这篇论文给出了一个能精确测量Mamba状态使用情况的工具,还发现模型会根据输入动态调整哪些状态起作用——基于这个发现做剪枝,效果比之前的方法好很多,7B模型上预算减半性能不变。
新基准VoxENES 2026用5万多样本和10种现代语音合成方法,测了8个检测器,最佳EER才28.98%,说明现有检测器对LLM语音基本失效,做语音安全的朋友可以看看。
这篇论文讲了Transformer的理论短板——表达性研究够了,但学不学得会还不知道。他们用C-RASP给出了样本复杂度的初步界限,对想深挖模型理论的人很有用。
想了解如何自动化挖Claude Code和Codex的漏洞?这篇论文提出了AHA方法,比现有方法强14%,还能跨场景复用。搞智能体安全的值得看。
这篇论文把专家组合从全局加权改成了因子级路由,在ARC-AGI上效果更好,适合研究离散扩散或组合生成的人看。
这篇论文提出沙漏推理,让GPT-5.5和Gemini 3.1 Pro在ARC-AGI、ChipBench等基准上大幅提升,不是靠新模型,而是靠精巧的推理结构设计,值得搞推理的人看看。
这篇论文梳理了从世界动作模型到具身大脑的路线图,对搞具身智能的研究者很有参考价值。
这篇论文用具体实验证明,多智能体系统里单独检查每个智能体的信息根本不够,分布式后门能让所有局部检查都正常,但组合起来就成攻击了。
想用更少的样本准确预测模型在手机上的延迟?HiFi-LLP带置信度打分,NAS提速8.6倍。
这篇论文给出了一个能自动处理混凝土养护延迟的调度方法,比遗传算法和调度规则都强,接近最优解的4%,还开源了测试基准,搞工厂排程的值得看看。
这篇论文解决了离线到在线RL中一个关键难题:在有限交互次数下,如何主动挑选微调策略而不是盲目均分预算。实验结果挺实在,值得做RL方向的朋友看看。
这篇综述把机器人语音识别的在线API和本地模型方案都讲透了,尤其适合想用Whisper做离线识别的开发者,ROS集成部分很有实操参考。
这篇论文教你怎么用单摄像头和CPU让无人车自己找回丢失的导引线,测试了119次,86%成功,三秒多就恢复。适合做低成本导航的开发者参考。
想省时间调智能体技能?这篇论文用李代数胚帮你快速找到最优编辑,比暴力搜快15倍。
这篇论文告诉你为什么监控量化的DeepSeek小模型不能用token概率,还给出了一个更靠谱的校准方法,真正提升了准确率。
论文搞了个8B的小模型FATE,专门给AI老师打分,比蒸馏前涨了22个点。还顺便测了Gemini、ChatGPT等,Gemini 2.5 Flash得分最高,挺有意思。
想研究LLM在社交推理中的真实信念?MafiaScope用探针实验和反事实回放,让你看到智能体表面的伪装。DeepSeek案例数据很硬核。
这篇论文提出了EYT-Bench,能更真实地测出LLM在多轮对话中的意图追踪能力。用16/17模型发现推理模式大幅提升长上下文准确率,值得关注。
想知道LLM交易模型到底能不能赚钱?这篇论文给了诊断工具TradeLens,实测DeepSeek-V3.2选股不行,GLM-4.7择时也翻车,不吹准确率而看利润转化。
这篇论文用10个真实bug和5个流行LLM测试了它们能否直接从业务需求写测试断言,发现效果还行但差异大。如果你想了解LLM在自动化测试中的实际能力,这篇值得看看。
如果你想用LLM做群体推荐,这篇论文给出了一个基于微调和动态策略选择的新方案,284人的实验验证比传统方法更让人满意。
这篇论文讲了一个新的fMRI对齐方法SpectralOT,在保留解剖结构的同时提高了跨被试解码的准确性,做神经科学研究的可以看看。
这篇论文用Pythia模型实测了Transformer内部动力学的红外组织现象,发现记忆核呈标度无关性,挺硬核的理论研究。
NAILS不用重训练就能让推荐结果更符合公平、多样性的规范,而且几乎不牺牲用户参与度,很实用。
TWIN这个新模型可让药物和蛋白质模拟达到从头算精度,而且比DFT快100倍,值得做分子模拟的人看看。
这篇论文严格验证了Berthier等人的分层学习时间尺度猜想,对理解深度网络训练动态很有帮助。
想用更少的点表示信号?这篇用复数奇点,32个点顶1024个网格,重建更准还能恢复物理参数,值得看看。
这篇论文解决了现实场景中演示数据不确定的问题,用汉明距离和伪布尔优化改进LTL学习,结果更靠谱,适合做形式化验证的朋友看看。
这篇论文把NL2SQL的优化组件拆开对比,告诉你NatSQL、微调、重排序器怎么搭配才最有效,不是堆砌就行。
想用小样本数据做材料逆向设计?这篇用INCRT处理复杂物理约束,给出一套比单纯优化更靠谱的候选筛选方法。
终端代理训练数据难找,SETA开源了4500+环境的RL数据集,Qwen3-8B训后Terminal-Bench拿到12%,顺带还让DeepSeek-V4涨了分,搞终端AI的别错过。
这篇论文用Isabelle/HOL把一阶模态逻辑的深和浅嵌入都严格形式化了,还自动化证明了忠实性,做形式化逻辑或模态逻辑验证的值得看。
这篇论文提出了LOGOS,一个让AI团队自我进化同时受人类控制的框架。它不替换现有系统,而是增加了治理层,确保问责。
一篇论文搞了个模块化框架,用沉思原则来评估和提升LLM在心理健康领域的对齐,还能套用到其他领域。
这篇论文采访了20位一线从业者,总结出SE Agent开发的真实流程和六类坑,做智能体项目前建议先看看。
想搞3D生成质量自动评估?这篇论文告诉你:光选模型不够,整个评估管道都得调。六视图RGB就够用,省成本。
这篇论文把LLM智能体在狼人杀中的信念和行为拆开审计,发现加信念能让好人胜率从20%提到39%,但行动和信念不太一致,框架本身是个好工具。
这篇论文提出了一个实用的容错框架DAS,专为工业场景下的异构智能体协作设计,解决了累积错误传播的老大难问题。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。