AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报

因果审计

共 2 条相关 AI 资讯
8月7日
13:28
13:28官方账号arXiv cs.AI@Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
论文提出视觉证据增益(Visual Evidence Gain)估计量,在策略、轨迹、步骤三个层级干预,审计多模态大模型的裁剪缩放等视觉工具调用。对 6 个代表性模型和 5 个细粒度感知基准的测试显示,工具调用相对直接推理的准确率提升有限,甚至为负,而 token 成本明显更高。作者识别出两种失败模式:Calling Without Looking 中返回的观察对答案无因果作用,Looking Without Planning 中观察有信息量但调用次序不合理。轨迹级诊断表明,策略级准确率增益集中在少数校准良好的轨迹上,作者称之为视觉工具使用的幻觉。代码已在 GitHub 的 OpenCausaLab/CauAudit 发布。
论文多模态视觉工具使用因果审计

推荐理由:这篇论文查了6个模型的视觉工具调用:多数只是白花钱,只有少数轨迹真有用。别被表面准确率骗了。
原文
8月6日
09:20
09:20官方账号arXiv cs.LG@Jiaming Cheng, Subhransu Das, Rajiv Ramnath
多智能体LLM系统中,智能体间通过中继KV缓存而非文本交换信息。论文用错配缓存、清零缓存和矩匹配随机缓存做因果审计,覆盖LatentMAS、KVComm、C2C等系统。在接收方需要发送方私有信息时,主骨干上的相关中继达到100%,无关中继仅23%-25%。在不需要私有信息时,预注册五种子协议在GSM8K、ARC-Challenge、MedQA上显示等效性差异在2.8个点以内。清零中继造成14.7个点下降,而错配缓存仅0.4个点,说明缓存效应不一定来自示例配对。
论文KV Cache多智能体Qwen3

推荐理由:这篇论文给出了一套错配缓存审计法,对比LatentMAS、KVComm、C2C后发现,基准涨分不等于真在传潜在思维。
原文
今日全部早读东盟登录