09:33官方一手arXiv: DeepSeek@Huimin Wang, Zhengyi Zhao, Yutian Zhao精选73°ClinTraceBench 包含 385 个来自 MIMIC-IV 的验证对话,采用九项任务分类和 L0-L4 确定性验证。研究评估了八种历史表示策略,包括检索、压缩方案和智能体记忆系统,在 6,271 个问题上进行了 200,672 次预测。研究发现压缩策略在多访视趋势和跨患者比较上存在聚合损失,盲法与全上下文方法差距达 29.8-62.7 个百分点。论文ClinTraceBenchMIMIC-IV临床推理推荐理由:斯坦福团队发布临床推理基准,测试八种历史表示策略,发现压缩导致关系损失,小模型 Haiku 在全上下文下超越大模型 Sonnet。原文稍后读已读值得跟进有用关注 ClinTraceBench
10:41官方账号arXiv cs.AI@Naman Garg, Sarika Jain, George FazekasSemiintelligencn团队针对ACM RecSys 2026 TalkPlayData挑战赛提出多模态个性化对话音乐推荐系统,采用三阶段流程:多模态检索、轻量级重排序和GPT-4o-mini个性化响应生成。优化RRF权重提高MRR+19.5%,提交系统在Blind B测试中得分0.3213。论文多模态语义扩展约束型LLM重排序对话音乐推荐推荐理由:Semiintelligencn团队提出的多模态音乐推荐系统,结合了多种技术和模型,优化了推荐效果,值得一试。原文稍后读已读值得跟进有用关注 多模态语义扩展
09:28官方一手arXiv: DeepSeek@Zhuo Xie, Haoze Ni精选论文提出多源证据共识验证框架MECV,用于修正AI生成新闻摘要中的幻觉。MECV聚合源文档、维基百科和开放网页检索三类异构证据,并引入多LLM陪审团机制,通过矛盾感知共识评分评估事实可靠性。在SummEdits基准上使用GPT-4o-mini和DeepSeek-Chat作为验证模型、Qwen-Plus作为编排器进行实验。结果显示MECV在保持摘要语义结构的同时提升了事实一致性,跨源共识可作为识别事实不确定性的有效信号。论文MECVSummEditsGPT-4o-mini推荐理由:这篇论文解决AI摘要瞎编的问题,用多源证据+多模型投票来纠错,在SummEdits上验证有效,做新闻聚合的可以看看。原文稍后读已读值得跟进有用关注 MECV
09:20官方一手arXiv: DeepSeek@Zewen Liu论文提出Contagion Tensor框架,量化多智能体LLM输出分布间的耦合。基于该张量定义Coupling Amplification Factor (CAF),形式为CAF=E[T_condition]/E[T_baseline],提供无单位基线比较。在2x2x2块正交仿真中,图像条件超线性效应(CAF=1.40)在禁用图像扰动模块后降为亚线性(CAF=0.87)。真实API实验:DeepSeek-Chat (R=30)和GPT-4o-mini (R=15,真实视觉)在统一人格下文本通信CAF≈1.0,多样人格导致收敛(CAF=0.88)。GPT-4o-mini内对比:C3 (文本) CAF=1.02 vs. C5(真实视觉,R=30) CAF=1.72,验证仿真预测。论文Contagion TensorCAFDeepSeek-Chat推荐理由:想了解多智能体LLM之间怎么互相影响输出?这篇论文给出了可量化框架CAF,还拿DeepSeek和GPT-4o-mini做了实验,能看到图像条件会放大耦合效应。原文稍后读已读值得跟进有用关注 Contagion Tensor