这篇论文从信息瓶颈角度讲清楚了多智能体系统在什么时候比单智能体更有优势,还通过18个实验验证了弱模型受益多、强模型受益少。
全部动态
这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。
CRAFT能帮你找到模型具体弱在哪里,不是笼统说不行,而是通过评分标准拆解能力,还能自动生成训练数据修bug。金融和法律测试里比随机采样效果好很多。
这篇论文用象棋做实验,清晰展示了预训练对强化学习效果的预测关系,1B模型验证了规律,读起来很扎实。
这篇论文提出了HCIG和GCCN,在MMSD和MultiBully上分别达到85.74%和69.62%准确率,比传统融合方法更善于捕捉图文矛盾。
做VLA模型微调或机器人仿真的团队可以看看,JoyNexus用分组批处理省GPU资源,多租户场景下效率更高。
这篇论文解决了OCT分割跨域泛化难题,用空间归一化让不同来源的数据对齐,实验扎实,适合研究视网膜影像和医学图像分析的朋友。
这篇论文用Qwen3-8B做了AppWorld上的合并vs联合训练对比,发现合并效果不输联合训练,而且解释了为什么不同合并方法结果差不多。
想用 AI 管理整个科研流程?SciForge 把论文、代码、数据整合成可追溯的工作状态,还帮你做基因发现和蛋白质设计,开源可玩。
这篇论文用RTS平滑器引导神经网络学缺失的微分方程,部分观测下就能恢复动力学,还能保持模型解释性。
这篇论文提出一种新的动态视角合成方法,通过分开记忆更新和应用的频率,实现了实时处理,而且能记住长视频里的短暂遮挡区域。
这篇论文用链上交易数据和推特情绪来给比特币情绪分类,XGBoost模型F1到了0.84,还用了SHAP解释特征重要性,对做加密货币分析的人有参考价值。
这篇论文提出了一种不用重训练就能实时更新用户嵌入的方法,用KP-tree存储偏好,在KuaiRec上只用1.8%数据就比ALS效果好,速度还快8倍。
这篇论文提出了数据驱动的块更换调度算法,用多臂赌博机方法优化维护成本,在理论遗憾界和实际效果上都有亮点,搞运筹或机器学习的人可以看看。
这篇论文提出了一个从论文修订数据中学习编辑科学图表的框架,还附带了一个基准,适合想做图表自动化编辑的研究者看看。
这篇论文把安全代理的评估从只看成功率,改成同时算成本账。用Cybench和Splunk BOTS v1实测,发现开源的进攻型代理性价比不错,但防御型代理光给推理预算不够,得改进工具使用。
多智能体协作搜索老是卡壳?论文提出SearchOS,用显式状态管理和管道并行调度解决重复循环,在WideSearch和GISA上全面领先。搞检索智能体可以看看。
想用自然语言问交通因果问题?teLLMe这个新框架可以帮你,它用PC算法和DoWhy分析BDD驾驶数据,结果以Causal Card呈现,直观清晰。
AutoSynthesis能自动完成整条元分析流水线,效果媲美专家手工操作,让证据综合不再依赖人工
想了解提示语言怎么影响代码生成质量?这篇实测了GPT-4o mini、DeepSeek和Claude在多种语言下的表现,结果英文不一定最好。
想给模型加新语言但不想从头训?这篇论文的原地分词器扩展办法,让LFM2.5在印地语和越南语上token数砍半,解码快3倍,代码和权重都开源了。
这篇论文发现LLM的物理危险和文本内容危险是分开的,PRISM探针只需一层就能检测物理危险,误报率只有LLM裁判的一半,值得做安全对齐的人看看。
这篇论文提出了检测模型生成描述时系统性偏差的新方法和基准SymbalBench,比之前方法好用4倍,适合需要审计多模态模型输出的人。
新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。
这篇论文提出一种结合LLM和专家验证的抑郁症标注框架,能自动生成符合DSM-5-TR标准的推理轨迹,减少人工修订。适合研究可解释AI和心理健康数据标注的人。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档