这篇论文从信息瓶颈角度讲清楚了多智能体系统在什么时候比单智能体更有优势,还通过18个实验验证了弱模型受益多、强模型受益少。
这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。
这篇论文给出了AI系统生命周期可信度评估的具体方法,用决策树生成可读的规则和阈值,适合做治理合规的工程师看看。
CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。
这篇论文给了我们一套统一安全阈值的方法,让不同公司的标准能对齐,避免恶性竞争。如果你关心AI安全怎么落地,可以看看。
这篇论文用象棋做实验,清晰展示了预训练对强化学习效果的预测关系,1B模型验证了规律,读起来很扎实。
这篇论文用扩散模型来对齐强化学习中的不同环境动态,不用额外复杂设计就能搞定域适应,比现有方法好。
这篇论文提出了HCIG和GCCN,在MMSD和MultiBully上分别达到85.74%和69.62%准确率,比传统融合方法更善于捕捉图文矛盾。
做VLA模型微调或机器人仿真的团队可以看看,JoyNexus用分组批处理省GPU资源,多租户场景下效率更高。
这篇综述把LLM智能体怎么用在5G/6G网络上讲清楚了,覆盖架构、协议和标准化,做通信AI的可以看看。
这篇论文解决了OCT分割跨域泛化难题,用空间归一化让不同来源的数据对齐,实验扎实,适合研究视网膜影像和医学图像分析的朋友。
这篇论文用Qwen3-8B做了AppWorld上的合并vs联合训练对比,发现合并效果不输联合训练,而且解释了为什么不同合并方法结果差不多。
想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。
研究者发布了Loopie循环Transformer,用更少活跃参数在IMO和IPhO拿到金牌,比普通模型强很多。
想用 AI 管理整个科研流程?SciForge 把论文、代码、数据整合成可追溯的工作状态,还帮你做基因发现和蛋白质设计,开源可玩。
看看这个新思路:用表格基础模型做电力系统安全评估,每个故障只需要120个样本就能达到九成准确率,比传统方法省了两个数量级的标注数据。
想看量子机器学习怎么防遗忘?这篇用QFI替代传统方法,在VQC上效果更稳。
这篇论文发现WAM模型有严重安全漏洞——加一点点视觉干扰,机器人就会想象正常但行动出错,成功率从96%掉到43%。搞机器人安全的得看看。
这篇论文用RTS平滑器引导神经网络学缺失的微分方程,部分观测下就能恢复动力学,还能保持模型解释性。
这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。
这篇论文用范畴论搞了个LINCS框架,专门修复模型中的非组合性问题,数学推导扎实,适合想深挖机器学习理论的人。
MeanFlowNFT让平均速度生成器也能用上强化学习,4步生成效果比50步的RL模型还好,值得试。
这篇论文提出一种新的动态视角合成方法,通过分开记忆更新和应用的频率,实现了实时处理,而且能记住长视频里的短暂遮挡区域。
这篇论文用链上交易数据和推特情绪来给比特币情绪分类,XGBoost模型F1到了0.84,还用了SHAP解释特征重要性,对做加密货币分析的人有参考价值。
这篇论文提出了一种不用重训练就能实时更新用户嵌入的方法,用KP-tree存储偏好,在KuaiRec上只用1.8%数据就比ALS效果好,速度还快8倍。
这篇论文提出了数据驱动的块更换调度算法,用多臂赌博机方法优化维护成本,在理论遗憾界和实际效果上都有亮点,搞运筹或机器学习的人可以看看。
NeuronSoup用遗传算法进化共享神经元图,不依赖反向传播,在MNIST上达到85.9%准确率,模型只有115KB,适合探索非梯度训练的新路子。
NVIDIA发布了RoboTTT,能把机器人策略的上下文窗口做到8000步,看懂人类演示后直接模仿,长任务完成率比单步模型高87%。想了解机器人怎么学更长历史可以看这个。
这篇论文提出了一个从论文修订数据中学习编辑科学图表的框架,还附带了一个基准,适合想做图表自动化编辑的研究者看看。
这篇论文讲了一种真实的预训练数据投毒方式——通过论坛评论注入恶意内容,还给出了分析工具HalfLife,搞AI安全的值得看。
SceneBind 把场景的“是什么”和“在哪里”一起建模,场景和空间检索都做到了 SOTA,还能零样本搞定音视频定位。
这篇论文把安全代理的评估从只看成功率,改成同时算成本账。用Cybench和Splunk BOTS v1实测,发现开源的进攻型代理性价比不错,但防御型代理光给推理预算不够,得改进工具使用。
多智能体协作搜索老是卡壳?论文提出SearchOS,用显式状态管理和管道并行调度解决重复循环,在WideSearch和GISA上全面领先。搞检索智能体可以看看。
想用自然语言问交通因果问题?teLLMe这个新框架可以帮你,它用PC算法和DoWhy分析BDD驾驶数据,结果以Causal Card呈现,直观清晰。
AutoSynthesis能自动完成整条元分析流水线,效果媲美专家手工操作,让证据综合不再依赖人工
这篇论文用四个LLM当裁判,比较了Grok写的百科和维基百科的政治中立性,结果发现Grok版也不中立,甚至更偏,还各有倾向。
想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。
想给模型加新语言但不想从头训?这篇论文的原地分词器扩展办法,让LFM2.5在印地语和越南语上token数砍半,解码快3倍,代码和权重都开源了。
这篇论文发现LLM的物理危险和文本内容危险是分开的,PRISM探针只需一层就能检测物理危险,误报率只有LLM裁判的一半,值得做安全对齐的人看看。
这篇论文提出了检测模型生成描述时系统性偏差的新方法和基准SymbalBench,比之前方法好用4倍,适合需要审计多模态模型输出的人。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。