研究人员发布LongPIBench基准,测试了长上下文场景下的提示注入防御效果,发现现有防御存在显著漏洞。
VERA-8B是首个专门针对审计风险预测的模型,能将SEC文件转化为可审计报告,比传统金融语言模型更注重证据支持。
这篇论文研究了LLM交易代理是否存在可预测的结构性行为,发现其决策存在稳定的逆向时机模式。
MAP基准测试首次评估AI系统如何帮助有无障碍需求的用户规划实地访问,包含主张验证和视觉证据检索两项创新评估。
8个分类任务+30个模型研究显示,LLM说的自信程度和实际内部自信经常不一致
医疗教育者新思路:用SCAN框架解决AI使用分类问题,比单纯禁止更有效。
脑瘫儿童个性化康复的新模型,预测准确且响应快,但肌肉力量建模仍是挑战。
EvoUndo解决了LLM智能体自我修改后难以恢复的问题,在gpt-oss-120b和Qwen3.8-27B上验证了有效性。
这篇论文教你如何设计测试策略,即使有人用 AI 作弊也能得到真实结果。
论文提出RA-OPD解决教师模型误导问题,在数学和代码基准上显著提升性能。
新研究用图结构改进长对话问答的证据召回,在LoCoMo数据集上提升近5%,但未改变最终答案质量。
研究人员为小模型对话游戏代理设计了一套三步训练法,显著提升了特定任务表现,同时保持通用能力。
这篇论文揭示了广义样条与高斯过程在无限维逆问题中的等价关系,能连接多种已知数学方法。
SWA比线性注意力更高效,无需后训练就能实现更好性能,内存占用低,推理速度快。
新方法让Muon优化器在LLM预训练中跑得更快,尤其擅长沿着平坦方向加速训练。
研究人员提出EFNOs,解决了FNOs跨域迁移问题,在热方程和材料科学任务中表现优异。
SymboLLM-FE用符号回归+少量LLM调用,解决了表格数据特征工程的可解释性和效率问题,比现有方法更实用。
FedeSpu团队发布了首个视频语言模型后训练技术,能检测视频中的执行错误,对未见任务效果提升11.6%。
电商推荐系统新方法:用生存模型替代多分类器,复购预测更准确且模型更轻量。
这篇论文解决了量子设备异构性问题,用Bures-Uhlmann几何改进了联邦学习,在噪声环境下表现更好。
这篇论文提出了一种新方法,能精确定位哪些观测值导致样本偏离参考分布,在LHC奥运会上表现出色。
SHRED模型让聚变反应堆监测更准更快,误差仅5%,还能处理不同磁场和角度的复杂情况。
GRACE解决了LLM遗忘中遗忘集和保留集推断问题,通过梯度引导方法提升模型效用,比现有梯度选择方法更稳定。
孟加拉语医疗问答系统BanglaMed-QA上线,解决低资源语言医疗信息缺口,准确率达95%。
OpenEuroLLM团队开源了预训练研究,揭示了学习率和批量大小如何随模型和数据规模变化。
VISTA方法改进了OPSD蒸馏技术,通过验证器指导教师自适应,在数学推理任务上显著提升性能。
PASK让结构化生成更高效,在保持准确性的同时大幅降低内存使用,提升处理速度。
TransMod解决了多模态交通预测难题,能在数据不足时从其他交通模式迁移知识,提升预测准确性。
UCI数据集验证,残差引导方法让随机神经网络训练更高效准确。
研究人员提出SinkSLOT算法,大幅提升最优传输计算效率,适用于大规模数据集。
英国研究显示,机器学习作为标准氮肥建议的校正工具可提升利润,而非直接替代。
这篇论文揭示了结构化SVM中Fisher一致性的微妙边界,给出了最小反例和精确分类。
TraceBench发布了首个LLM智能体时间序列根因评估框架,包含数据集、实验结果和排行榜,tracebench.github.io可访问。
斯坦福团队用基础模型解决电池老化检测难题,一张图像就能获取全颗粒统计,比人工标注快数百倍。
CMU团队新方法PDPO让机器人能提前规划5步动作,在拥挤人群中导航成功率更高。
论文提出用图神经网络解决相关聚类问题,推理时间降低5个数量级,还能作为图分类的池化层。
这个超轻量级定位系统功耗仅180微瓦,能精准追踪38毫克的蜜蜂,为昆虫行为研究提供了新工具。
康奈尔大学团队推出超大规模MIMO系统,用物理超表面实现机器学习,波域处理精度媲美数字模型。
TRACE-CRC解决了多步CSI预测中的不确定性量化问题,比传统方法更可靠且不确定性球更小。
这篇论文提出了一种新的有向图学习方法,能在保持精度的同时优化谱特性,对图神经网络研究很有价值。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。