全部动态
This review delves into the challenges of On-Policy Self-Distillation, highlighting the 'collapse' issue and offering insights into its causes. It's a must-read for those interested in understanding the nuances of model training with privileged information.
TAU-Agent 是一款用于交通异常理解的新框架,通过结合视频字幕和跟踪工具,实现了对交通视频的异常检测和解释,其在基准测试中的表现值得一看。
Code World Model结合了语言模型和视频模型,通过编码代理实现世界大脑,为开放式世界模型提供新路径,值得了解。
这篇论文提出了一种新的空中交通管制程序运行时监控框架,通过结合无线电通信、监视数据和机载观察,能够有效识别程序偏差,对于提高空中交通安全具有重要意义。与传统的监控方法相比,该方法在真实交通和合成情况下的表现都十分出色,值得深入研究。
这篇论文揭示了GNN-based KGQA在对抗性攻击下的弱点,特别是子图构建阶段,对于理解KGQA系统的鲁棒性具有重要意义。
这篇论文提出了一个评估现实世界车辆交互中博弈论结构的框架,通过分析真实世界数据集,揭示了车辆交互中的时间结构和行为模式,为理解车辆交互提供了新的视角。
这篇论文提出了一个新颖的时间序列解释框架{\modelname},它结合了归因和反事实解释,对于需要透明和可解释模型行为的应用来说非常有用,值得一读。
这篇论文详细评估了咳嗽结核病模型的泛化能力,揭示了数据收集和设备差异对模型泛化能力的影响,为结核病筛查模型的开发提供了重要参考。
这篇论文揭示了AIWP模型预测准确性的来源和缺陷,对理解AI模型在气候预测中的应用具有重要意义。
这篇论文揭示了大型语言模型在不同语言中的技能差异,对于理解多语言模型的发展具有重要意义。
XREPOTEST提供了针对大型语言模型单元测试生成的挑战性基准,揭示了不同模型在不同上下文下的表现差异,值得研究。
这篇论文提出了一个名为PRGuard的新工具,用于评估自动代码审查工具在拉取请求中的安全价值,与现有工具相比,它能够更准确地识别目标漏洞,值得一看。
Read this paper if you're interested in understanding how to measure and improve the structural accuracy of LLM-generated structured outputs. It introduces a new framework and a method that could lead to better AI applications.
This paper introduces a new reporting protocol for scientific reports that could significantly improve reproducibility. It's a must-read for anyone interested in improving the quality of scientific reporting and the use of LLMs in research.
研究揭示了自进化的编码智能体中的自毒化问题,并提出了counter-prompt防御措施,有效降低了恶意技能的传播。对于关注AI安全和智能体研究的读者来说,这是一篇不容错过的论文。
想了解多智能体如何进行数学发现的读者,这篇论文值得一读。它展示了在开放世界中,多智能体如何通过协作和自主学习实现数学发现,与传统的数学发现方法有所不同。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档