全部动态
这篇论文用Petri网编排LLM,自动生成并发Rust API的测试用例,比纯LLM生成的更可靠,能挖到深层并发bug。
GS-Agent把多个AI智能体和物理引擎连起来,你只要说句话就能生成带物理模拟的4D场景,液体、物体碰撞都能搞定,做内容创作或模拟都省力。
这篇论文把AI代理失效的真正原因讲透了——不是推理不行,而是管不住上下文。还给了个参考实现,LongMemEval和LoCoMo成绩都90%以上。
这篇论文揭示了LLM中一种不易察觉的修辞滥用,并给出了具体测量和缓解方法,适合关注模型文本风格和RLHF影响的读者。
AREX这篇论文让AI自己递归改进答案,在多个搜索和推理基准上超越了同体量模型,想了解自我优化怎么做可以看看。
这篇论文用智能体自动发现概念,让REIMS数据的手术切缘评估更可解释、更准确,真实术中场景也表现更好。
一篇新论文提出了MAPS架构,用层次化强化学习解决无信号交叉口的多车协调问题,在72种场景下实现无碰撞且更快通行,还能零样本从3车迁移到5车,效果很扎实。
想知道开源模型做数据清洗行不行?这篇论文用真实研究数据测试了31-35B模型,近九成任务都能搞定,隐私保护场景也能用。
这篇论文发现了一个反直觉的安全漏洞:把危险目标藏起来经过中介传递,反而让模型更容易执行它。对做LLM部署或安全审查的人很重要。
想测LLM的长对话记忆力?RUMBA这个俄语基准能细粒度诊断模型在时间推理上的强项和短板。
这篇论文搞定了视频换脸的身份漂移问题,用闭环反馈自动找关键帧来固定身份,还顺便修复了皮肤太假的美颜感。比起只靠首尾帧的老方法,思路清晰多了。
这篇论文提出了WML方法,能精准定位Agent工作流失败节点并复用外部技能知识,在SpreadsheetBench和Compiler-Supported50上表现亮眼,比直接SkillAgent省不少token。
这篇论文用具体数据告诉你,GPT和DeepSeek在形式化验证上还比不上ProVerif这些专业工具,但推理模式能把精确率拉到66%,可能当个预筛选过滤器。
用VirtualSet替代SQL,让LLM查询出错时提前报类型错误而不是给假结果,BIRD上还比SQL高4个点,很适合做安全决策。
PG-KINN用Petrov-Galerkin方法结合KAN,在多个力学难题上精度超过PIKAN和MLP,值得做计算力学的人试试。
这篇论文用IBM量子硬件实测量子核方法的几何保真度,发现门扭曲最可靠但任务相关性反而低,揭示了硬件实现与算法目标之间的差距。
这篇论文提出了iPANN和fPANN,用区间和模糊集处理本构建模中的不确定性,能包围噪声观测,还能把不确定性传到有限元仿真里。
这篇论文提出了SPDNN方法,专门解决训练数据和目标数据分布不同的问题。它能量化回归和Huber回归,还能处理时间序列依赖数据。理论证明能达到最优收敛速度,挺扎实的。
这篇论文拆穿了为什么PortLLM的补丁隔了好几轮预训练还能用,理论部分用高维空间特性讲得特别清楚。
想要可解释的回归模型?这篇论文展示了Ex-Fuzzy库的新能力:用10-15条规则就能达到0.86的R²,比黑箱模型还直观。
这篇论文用专家聚合让贝叶斯在线学习自适应,无需事先设定学习率或先验,实验还证明能自动跟踪最强专家。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档