7月28日
12:05
12:05官方一手arXiv: DeepSeek@ Zing Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu
Zing是一个集成框架,用于测量、内化和落地LLM的社会智能。其评估基准SoMBench覆盖3个主要维度、17个次要维度和71个任务范式,包含284个共享场景和3481个专家验证实例。在20个代表性LLM上的评估显示最高准确率仅72.08%,17个次要维度均未达90%。Zing训练方法在5个社会认知基准上持续超越基础模型,其中Zing-27B-Stage2取得最高平均分,Zing-32B-Stage2与DeepSeek-V4-Pro竞争。Actio推理架构通过PRISM、Starling、SAGE和门控RAG四种支持,在15个模型-基准对中提升14个。
事件专题

推荐理由:这篇论文发布了一个综合框架,让你看到当前LLM在社会智能上的短板(最高才72%),并提出Zing训练和Actio推理搭配,能显著提升表现。想了解模型怎么更懂社交规矩的可以看看。
7月27日
11:57
11:57官方账号arXiv cs.AI@Fin Gentzen, Marla Grunewald, Iulisloi Zacarias, Mounir Bensalem, Admela Jukan
该论文提出一种自校准智能体AI框架,通过集成ARIMA预测器动态逼近真实值,减少LLM驱动系统中的运行漂移。在零知识工作负载的边缘资源使用场景中,该框架的资源使用预测准确率比基线LLM智能体高91.7%,预测速度提升71.7%。自校准机制采用的ARIMA跳跃算法比标准ARIMA生成真实值快52%,且精度相同。实验验证了该框架在去中心化基础设施中部署自主AI的可靠性。
推荐理由:这篇论文讲了一个能自己校准的智能体框架,用ARIMA预测把资源分配准确率提了91.7%,速度还快了71.7%。搞边缘计算或零知识证明的可以看看。
10:58
10:58官方账号arXiv cs.LG@Ritik Raj, Souvik Kundu, Sarbartha Banerjee, Dheemanth Joshi, Ishita Vohra, Tushar Krishna
TRACE-ROUTER 提出任务级路由框架,将每个任务在受理时通过上下文赌博机分配一次模型,后续所有LLM调用均固定到所选后端,并使用最终奖励更新策略。在 tau2-Bench 上,该方法比延迟匹配的单个模型插值高出7-8个准确率点。在 Terminal-Bench 上,相比最强单模型基线,TRACE-ROUTER 以36%更低延迟实现7.1个准确率点提升。该框架无需显式任务复杂度估计,即可学习适应工作负载的路由策略。
推荐理由:这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
7月25日
08:12
08:12Gary Marcus@GaryMarcus
Gary Marcus发帖指出,LLM行业牛方认为模型酷炫、芯片股飙升、收入增长。熊方则看到企业用户除编程外生产力提升有限、与中国价格战、LLM提供商在无芯片补贴下无法盈利、且模型依然不可靠。该帖获得24个点赞和1607次浏览。
推荐理由:看看Gary Marcus怎么用一句话说透LLM行业的冰火两重天,收入和股价飞涨,但企业实际收益和盈利问题依旧。
7月24日
11:52
11:52官方账号arXiv cs.LG@Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
研究提出基于开源LLM的多模态认知障碍检测框架,融合语音音频和转录文本。在ADReSS20和ADReSSo21基准上评估,分类准确率达92.4%。该框架优于单模态基线,并展现出跨数据集泛化能力。无需访问原始敏感数据,保护患者隐私。
推荐理由:这篇论文用开源LLM整合语音和文本,在ADReSS20上准确率92.4%,比只用单一模态强多了,且跨数据库也能用。
11:04
11:04官方一手arXiv: Anthropic@Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof
本研究通过提示Claude生成Prolog代码和测试,并使用LPTP进行形式化证明。Claude为前33个P-99问题生成了58个逻辑过程、508个测试和257个引理(共11800行证明)。作者手动检查了所有代码和证明,验证了类型、终止性、唯一性等性质。该实验展示了“vibe-coding/vericoding”方法用于Prolog编程的可能性。
推荐理由:一个用Claude写Prolog代码并用LPTP证明正确性的实验。有具体的数字和流程,适合对LLM+形式化验证感兴趣的人。
09:33
09:33官方账号arXiv cs.AI@Yangjun Lu, Hongyi Zhou, Fabian Spill, Kai Ye, Chengchun Shi, Jin Zhu
论文提出一种token级检测方法,通过平滑相邻token分数并采用自适应Lepski规则选择带宽,识别人机协作文本中由LLM生成的部分。该方法无需token级标注数据训练,在合成和真实数据集上优于多种基线。作者部署了公开网站实现该方法。
推荐理由:这篇论文给了一个新方法,能精确找出LLM写的片段,不用提前标注,比现有文档级检测更细。
07:40
00:53
00:53Gary Marcus@GaryMarcus
Gary Marcus指出,当前用户使用的ChatGPT/Claude并非纯大语言模型(LLM),而是结合了“Harness”的混合系统。他将这种组合称为神经符号AI架构。这一变化解释了为什么2024-2025年的模型相比2022-2023年的纯LLM有明显性能提升。
推荐理由:Gary Marcus解释了现在ChatGPT和Claude比两年前强的原因——它们加了层'Harness'变成神经符号系统了。
7月23日
11:28
11:28官方账号arXiv cs.AI@Yiming Wang, Jiayuan Di
本研究系统评估了大型语言模型(LLM)在文化负载翻译中的表现。使用《红楼梦》构建了500条中-日双语数据集,覆盖多种文化类别。发现前沿LLM对文化负载内容存在显著性能差距。人工评估中,不同文化背景的评估者导致明显分歧。常用自动评估指标如BLEU无法可靠评估翻译质量。
推荐理由:这篇论文用《红楼梦》测了LLM翻译文化内容的能力,结果发现GPT-4也不好使,连人工打分都吵起来了。适合关注翻译质量的人看。
7月22日
12:56
12:56官方账号arXiv cs.AI@Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini
本教程汇总了基于大语言模型(LLM)的智能体系统在软件工程、科学发现和金融等领域的生产级部署经验。内容涵盖推理与规划、多智能体协调和评估等研究进展,以及来自实际部署的挑战。通过制药发现和金融系统的应用案例,分析了成功设计模式和失败缓解策略,包括验证管线、回退机制和人在环路监督。
推荐理由:这篇论文从实际部署出发,总结了LLM智能体在软件、金融等领域的成功模式和失败应对,比只看benchmark的研究更有实战价值。
7月21日
12:20
12:20官方账号arXiv cs.AI@Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi
本论文提出了一种基于求解器的设计原则,确保数值结果来自可信工具并通过明确验证。在四个案例研究中,EVAgent在EV充电调度中复现了CVXPY最优解,并将LLM-only的未满足能量减少了7.5-9.5倍;GridDebugAgent修复了17/39个应急案例,总违规减少52.3%。论文提出了一个四组评估框架,涵盖任务效用、求解器正确性、忠实性与安全失败、成本与延迟。核心结论是智能体系统负责编排、检索与解释,可信工具负责计算,验证门控决定报告内容。
推荐理由:这篇论文把LLM智能体怎么用在智能电网上讲得很清楚,给出了具体的数字对比,比如EVAgent减少了7.5倍未满足能量,适合做电网AI系统的实践参考。
11:50
11:50官方账号arXiv cs.LG@Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov
结构药物设计(SBDD)利用蛋白质靶标3D结构生成候选分子,扩散模型是主流方法。本工作引入3D-Fit基准测试,评估LLM在多约束空间分子生成中的表现,包括蛋白口袋、锚定片段、药效团点及口袋-配体相互作用。结果显示,LLMs虽落后于专用扩散模型,但能同时处理多种空间约束,展现出可扩展的潜力。
推荐理由:这篇论文系统测了GPT等LLM在3D分子生成上的表现,发现它们虽不如专用扩散模型,但能同时处理多种约束,值得关注。
11:27
11:27官方账号arXiv cs.AI@Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang
论文提出Criterion-Distilled Policy Optimization (CriPO),针对评分强化学习中的两个问题:未探索准则(UC)和抑制准则(SC)。分析显示SC在训练中发生率超过57%,平均每样本1.8个SC。CriPO通过在线自蒸馏分别处理UC(构建准则注入自教师)和SC(反事实自教师翻转token级优势),在医学和科学基准上一致优于基线,训练步数减少约2倍。
推荐理由:这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
11:26
11:26官方账号arXiv cs.AI@Huzaifa Shaaban Kabakibo, Eric Schniedermeyer, Artem Burchanow, Lin Wang
SelectInfer是一个神经元级优化框架,通过离线分析识别任务特定和通用神经元,实现选择性加载和动态计算。在多个数据集上评估,内存占用减少40%-60%,计算量降低30%-50%,同时保持任务性能。该方法无需重新训练或微调,适用于资源受限的边缘设备。
推荐理由:这篇论文提出了一种在手机上跑大模型的新思路:不加载全部神经元,只算有用的部分。效果不错,内存和计算都省很多,关键是精度没掉。