10:11官方账号arXiv cs.AI@Huang Peng, Jiuyang Tang, Weixin Zeng, Hao Xu, Xiang ZhaoMACR针对LLM推理中参数知识与外部上下文之间的冲突,提出了一种显式消解机制。该方法首先用修改的语义熵衡量模型对答案的置信度,据此内部知识不足时再检索外部信息。然后引入三个专用智能体,分别归纳规则、分析潜在冲突并消解所有不一致。实验在多个基准上显著超过现有方法,并提供可解释的冲突消解过程。论文LLMMACR知识冲突推荐理由:这篇论文提出了MACR,能帮LLM自己判断知识是否可靠并解决矛盾,比过去的方法强不少,还能解释冲突。原文稍后读已读值得跟进有用关注 LLM
10:08官方账号arXiv cs.AI@Tingyue Pan, Mingyue Cheng, Daoyu Wang, Yitong Zhou, Jie Ouyang, Qi Liu, Enhong ChenScholarQuest 是一个基于超过1,000个计算机科学主题和四种研究意图(方法导向、场景锚定、比较型、范围控制)的学术论文搜索基准。该基准通过可扩展的答案构建和共享检索后端 ScholarBase 支持可重复评测。评测中最佳智能体方法在 Recall@100 上仅达0.314,在 Recall@All 上为0.355,表明搜索性能仍有巨大提升空间。研究还分析了搜索效率、意图级鲁棒性和失败案例。论文ScholarQuestLLM智能体推荐理由:想测你的LLM论文搜索智能体?ScholarQuest 给了1000多个主题和4种意图的标准测试,最强方法才0.314召回,你的能提多少?原文稍后读已读值得跟进有用关注 ScholarQuest
10:07官方账号arXiv cs.AI@Xinyi Zheng, Ling Shi, Tianlong Yu, Yongxin Zhao, Lorenz Goette, Kailong WangQMFOL是一个自动生成一元一阶逻辑推理任务的框架,可精确控制推理深度、宽度、标签类型和干扰项。基于该框架构建的QMFOLBench包含2880个实例、960种配置。在6个大型推理模型(LRMs)和2个LLM上的评估表明,逻辑复杂度增加时性能下降、计算开销上升。模型在True标签任务上表现优于False或Unknown任务,且对语义变化敏感。论文QMFOLLLM推理推荐理由:这篇论文提出了一个更好的推理测试方法QMFOL,能精细控制逻辑难度,用来测LLM推理能力更准。原文稍后读已读值得跟进有用关注 QMFOL
02:52官方一手Cloudflare Blog@Grant Bourzikas精选Cloudflare博客详解其多阶段漏洞发现工具的技术架构,包括状态控制机制、通过对抗性审查将误报率降低90%的方法,以及如何绕过LLM上下文长度限制(如4k token限制)。该工具实现自动化分类,每日可处理超过10万条告警。文章还公开了其基于GPT-4的分阶段提示词模板和缓存策略。技巧Cloudflare漏洞检测自动化推荐理由:Cloudflare公开了他们内部用的漏洞检测工具怎么做,从状态管理到对抗审查都讲了,想自己搭自动化安全工具的可以抄作业。原文稍后读已读值得跟进有用关注 Cloudflare
11:59AI Will@FinanceYF5根据Olivia Moore分享的数据,LLM(大语言模型)目前为Walmart和Target等顶级零售商贡献了接近2%的推荐流量。这一比例在过去一年中增长了三倍多。其中,电子产品、家居与花园等研究密集型类别的AI推荐流量增幅最大。行业LLMWalmartTarget推荐理由:AI现在真的能帮你买东西了!LLM给Walmart、Target带来的推荐流量一年涨了三倍,电子产品最明显,做决策前让AI推荐更靠谱。原文稍后读已读值得跟进有用关注 LLM
11:58AI Will@FinanceYF5据最新数据,LLM(大语言模型)已为Walmart、Target等顶级零售商贡献近2%的推荐流量。这一比例在过去一年增长了3倍多。流量增长最明显的品类是电子产品和家居园艺,均为研究决策较重的品类。行业LLMWalmartTarget推荐理由:想知道LLM怎么帮沃尔玛、塔吉特带货的吗?推荐流量占比快2%,一年翻三倍,电子产品最吃香。原文稍后读已读值得跟进有用关注 LLM
10:58官方账号arXiv cs.AI@Linus Sander, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll该论文提出一个包含对手方、负载、交互状态、发现机制和模式灵活性5个维度的分类法,对9个活跃维护的开源协议进行迭代分析。研究发现所有智能体间协议均结合混合负载与会话状态持久化,多数协议支持多个预定义模式,两个协议在运行时协商模式,显示模式灵活性趋势。去中心化发现仍属罕见。短期看协议将趋同统一智能体间与智能体-上下文通信,长期则可能发展为分层协议栈。论文LLM通信协议智能体推荐理由:这篇论文把9个主流的智能体通信协议拆成5个维度做分类,告诉你哪种协议适合什么场景,以及未来会怎么演进。如果你在做多智能体系统,想选协议或者设计协议,这篇很有参考价值。原文稍后读已读值得跟进有用关注 LLM
10:57官方账号arXiv cs.AI@Ikram Belmadani, Oumaima El Khettari, Carlos Ramisch, Frederic Bechet, Richard Dufour, Benoit Favre该研究以法语医疗问答为案例,比较了持续预训练(CPT)、监督微调(SFT)及其组合在Llama 2、Mistral、Bloom三个模型家族、7B-70B多种规模和三种初始化类型上的效果。对于多项选择问答(MCQA),CPT+SFT通常得分最高,但相对于单独SFT的提升很小且常不显著,SFT成为强且成本效益高的默认选择。对于开放问答(OEQA),CPT一致提升基于重叠的指标(如BLEU、ROUGE),而SFT常降低生成质量;指令微调和CPT+SFT在LLM评估中更受偏好。跨语言实验显示,法语适应可有效迁移到英语基准(如MedQA)。论文LLM医疗领域领域适应推荐理由:这篇论文用扎实的数据告诉你,在医疗领域微调模型时SFT性价比最高,CPT对开放问答有帮助但别盲目上全套,省钱又省力。原文稍后读已读值得跟进有用关注 LLM
10:57官方账号arXiv cs.AI@Haodong Chen, Xuanhe Zhou, Wei Zhou, Xinyue Shao, Yanbing Zhu, Bo Wang, Jiawei Hong, Anya Jia, Fan WuX+Slides 是一个评估大语言模型根据受众条件自动生成幻灯片的新基准。它覆盖 113 个主题和 7 种演示场景,使用 8133 个去重、基于源文本的探针,并引入四个互补指标:Audience Coverage、Domain-wise Coverage、Efficiency 和 Correctness。在 DeepPresenter、SlideTailor 和 NotebookLM 上的实验表明,在 τ_A=0.7 阈值下,NotebookLM 消融版达到最高 Audience Coverage 0.853,而 DeepPresenter 为 0.714,SlideTailor 为 0.594。结果显示当前系统仍无法完整恢复受众关键信息,且视觉质量不能替代源文本验证。论文X+SlidesLLM幻灯片生成推荐理由:想了解如何科学评估AI做PPT的水平?这篇论文用113个主题和8133个探针,测出NotebookLM能覆盖85%的受众关键信息,比DeepPresenter和SlideTailor强不少。原文稍后读已读值得跟进有用关注 X+Slides
10:56官方账号arXiv cs.LG@Sanghyeok Choi, Henry Gouk, Esmeralda S. WhitammerLarge Language Gibbs 是一种利用大型语言模型条件分布进行结构化概率推理的MCMC方案。该方法通过迭代重采样单个变量避免单次自回归生成的顺序偏差,产生的平稳分布反映所有局部条件之间的折中。在合成分布采样、一致性推理和贝叶斯结构学习任务上验证了有效性。结果表明LLM条件作为MCMC转移算子可替代单次生成进行结构化推理。AI模型Large Language GibbsLLMMCMC推荐理由:这篇论文提出用LLM做MCMC采样,比直接生成更鲁棒,适合复杂推理场景,值得做概率建模的人看看。原文稍后读已读值得跟进有用关注 Large Language Gibbs
10:43官方账号arXiv cs.AI@Soheyl Bateni, Maryam AbdolaliClaMPAPP系统将LLM用作特征提取接口,而非直接诊断引擎,对自由文本病历进行模式约束提取后经确定性检查,再输入XGBoost分类器。该系统在两个德国医院独立儿科阑尾炎队列上评估,性能优于端到端LLM基线(包括开源和专有模型)。在内部和外部验证中,ClaMPAPP实现了最强整体诊断性能,并最小化漏诊阑尾炎病例。端到端LLM在敏感度-特异度权衡和叙事重排下表现更不稳定。论文ClaMPAPPLLMXGBoost推荐理由:这篇论文提出了一个实用设计:用LLM理解病历文本,但把最终判断交给更可靠的机器学习模型,值得做临床AI的看看。原文稍后读已读值得跟进有用关注 ClaMPAPP
10:42官方账号arXiv cs.LG@Nahum Korda, Gadi EvronOpenAnt是一个开源漏洞发现系统,将静态程序分析与大语言模型推理结合,采用多阶段流水线。它通过代码分解将分析面减少97%,仅保留从外部入口可达的攻击相关代码。系统通过对抗验证模拟攻击者能力评估可利用性,并自动生成动态验证环境在沙箱容器中执行。在OpenSSL、WordPress和Flowise等开源项目评估中,OpenAnt识别了之前未知的漏洞,同时大幅降低误报率。论文OpenAntLLM漏洞发现推荐理由:OpenAnt把LLM和静态分析结合起来做漏洞挖掘,在三个知名开源项目里发现了新漏洞,误报还少,值得做安全的看看。原文稍后读已读值得跟进有用关注 OpenAnt
10:02官方账号arXiv cs.LG@Zilong Zhang, Yi-Ting Hung, Lei Ding, Chi-Kuang Yeh该研究将LLM作为评判者时的语速偏见等系统性偏差定义为问题核心。作者将有限人类监督下的LLM评估建模为正-无标记学习问题。提出基于部分最优传输(Partial Optimal Transport)的几何审计框架,无需重新训练即可识别人类一致偏好并纠正有偏评判者。实验表明该方法在提升与人类偏好一致性、增强对呈现偏差鲁棒性上优于现有流水线,并提供可解释的置信度估计。论文LLMLLM-as-a-Judge正-无标记学习推荐理由:想治治AI裁判的偏袒病?这论文用数学几何直接纠偏,不用重训模型,比调prompt靠谱多了。原文稍后读已读值得跟进有用关注 LLM
09:46官方账号arXiv cs.AI@Xhevahire Tërnava论文对10个vibe coded C/C++项目进行分析,发现制品内变体性近乎为零,所有变体决策集中在生成时。提出VbR(Variability by Regeneration)方法,让LLM作为推导引擎,为每个变体生成无死代码的二进制。用一个wc产品家族演示了完整流程。该工作首次将产品线思想引入AI生成代码的变体性管理。论文Vibe CodingVbR产品线推荐理由:这篇论文用10个C++项目分析了vibe coding的变体性问题,还提出了VbR方法让LLM直接生成无死代码的二进制,挺有启发的。原文稍后读已读值得跟进有用关注 Vibe Coding
09:42官方账号arXiv cs.AI@Fengying Ye, Yanming Sun, Runzhe Zhan, Zheqi Zhang, Lidia S. Chao, Derek F. WongG-IdiomAlign是一个新的基准测试,以Wiktionary的英语注释为锚点,专门评估跨语言习语对齐能力。它包含两个协议:带类型干扰项的多项选择习语等价测试,以及通过有无注释对比生成来隔离语义锚点效果。实验发现,多种LLM在低资源语言上普遍倾向于直译,这是主要失败模式。添加注释后,在基于嵌入的语义度量下生成质量有所提升,但绝对性能仍然有限,说明开放输出空间仍有较大改进余地。对Qwen3-8B的分析表明,差异更多集中在注意力头而非层上,且优质生成与更强的注释锚定相关。论文G-IdiomAlignQwen3-8BLLM推荐理由:这篇论文搞了个G-IdiomAlign基准,专门测AI能不能理解不同语言的习语。结果模型爱直译,加了注释能好点但还差得远,值得一看。原文稍后读已读值得跟进有用关注 G-IdiomAlign
09:40官方账号arXiv cs.AI@Yafeng Wu, Huu Hiep Nguyen, Thin Nguyen, Hung Le论文提出CADE框架,用于时间序列问答。该框架通过点式线性编码器和MLP投影器将每个时间步直接映射到LLM嵌入空间,避免分词瓶颈和固定窗格损失。引入单向监督对比损失对齐时间序列嵌入与冻结类名文本锚点。在Time-MQA基准上,CADE在六个TSQA任务中一致优于开源和闭源LLM基线。论文CADE时间序列问答LLM推荐理由:这篇论文提出CADE,解决了LLM处理时间序列时丢了数值信息的痛点,用直接时间步嵌入和对比对齐,在Time-MQA上比GPT-4还强。原文稍后读已读值得跟进有用关注 CADE
03:12官方账号LangChain@LangChainAIBenchling AI负责人@nlarusstone在LangChain发布的视频中提出,理解LLMs应借鉴生物学思维而非传统软件工程。他认为LLM的错误模式和调试过程与实验生物学类似,需要迭代测试和大规模观察。该观点引发业界对LLM可解释性本质的重新讨论。行业BenchlingLangChainnlarusstone推荐理由:Benchling的AI负责人用生物视角解释LLM的奇怪行为,比技术文档好懂,推荐看看他的原话。原文稍后读已读值得跟进有用关注 Benchling
03:04Gary Marcus@GaryMarcusGary Marcus重申LLM不可靠的观点,称无法被驳斥。特朗普政府要求Anthropic确保Fable 5的护栏不能被绕过,但安全专家表示不可能完全阻止规避。Marcus认为这是生成式AI的普遍问题,而非Anthropic一家的问题。WIRED报道引述了相关官员和专家的意见。行业GaryMarcusLLMAnthropic10 个信源在谈事件专题推荐理由:权威AI批评家Gary Marcus再次发声,直指LLM根本不可靠,加上特朗普政府与Anthropic的对峙,这场AI安全争议你必须了解。原文稍后读已读值得跟进有用关注 GaryMarcus
12:00官方账号arXiv cs.LG@Longlong Zhu, Jiashuo Yu, Zedi Chen, Yuhan Wu, Zhifan Jiang, Yuchen Xian, Yimeng Liu, Jiajie Su, Shaopeng Zhou, Xingyuan Li, Hongyan Liu, Xuan Liu, Dong Zhang, Chunming Wu, Xiang ChenOmniPlan采用基于大语言模型的解释器将异构自然语言意图转化为统一偏好向量,并利用混合专家架构动态选择MIP求解器、启发式算法和DRL模型作为专家。在分布式机器学习推理卸载任务(包括决策树、SVM、XGBoost等)的真实测试中,OmniPlan实现了近最优卸载,延迟降低高达97.8%,网络设备资源消耗降低11.5%。论文OmniPlanLLM混合专家架构推荐理由:OmniPlan用LLM和混合专家做网络优化,在分布式ML卸载上延迟降97.8%,资源降11.5%,效果很直观。原文稍后读已读值得跟进有用关注 OmniPlan
10:43官方账号arXiv cs.AI@Henry Bodwell, Hong Yang, John C. Simeone, Kelvin Gorospe, Bella Sullivan, Lana Huang, Jessica Gephart, Sandy Aylesworth, Molly Masterton, Naren Ramakrishnan论文提出IUU+DB系统,利用大语言模型(LLM)从异构文档中提取非法、未报告和未监管捕捞(IUU)及相关海鲜欺诈、劳工虐待事件信息。系统可分类是否相关,提取行为者、地点、物种、船舶、违规类型及执法结果等关键数据,并支持去重和趋势分析。案例验证表明,IUU+DB能帮助组织碎片化证据,识别地理和行为热点,为学术界、非政府组织、行业风险评估及政府政策执行提供支持。论文IUU+DBLLM非法捕捞推荐理由:这篇论文搞了个IUU+DB系统,用LLM自动从大量文档里挖出非法捕捞和海鲜欺诈的线索,能帮监管者和研究人员快速定位热点区域,挺实用的。原文稍后读已读值得跟进有用关注 IUU+DB
10:42官方账号arXiv cs.AI@Michèle Finck大型语言模型已能生成至少中位质量的法律文本,但现有法律AI评估仅测量辅助性任务,无法评价其是否执行教义性法律推理。欧盟AI法案对高风险司法AI要求“适当准确性”,却因缺乏教义性推理基准而无操作内容。这篇论文首次系统定义该测量空白,并呼吁建立对应的标准化评估。论文LLMEU AI Act法律推理推荐理由:这篇论文直击法律AI评测的核心缺陷——现有基准只测写文书,不测真正懂法理。做法律AI或合规的朋友值得看看。原文稍后读已读值得跟进有用关注 LLM
10:41官方账号arXiv cs.AI@Yuwei Zhang, Tong Xia, Bianca Emmerich, Yu Yvonne Wu, Dimitris Spathis, Xin Liu, Daniel McDuff, Cecilia Mascolo论文提出WEQA,一个查询自适应智能体框架,统一LLM推理与可穿戴分析及建模工具。它采用LLM控制器合成执行计划,动态路由查询至传感器分析与预训练模型组合,并借助外部知识进行响应审计。研究团队构建了涵盖四个公开可穿戴数据集、三个健康领域的基准。实验显示,WEQA比LLM和智能体基线准确率高出24%。一项由12名医学专家和8名用户参与的盲测表明,其在有用性和临床合理性上有显著提升。论文WEQA可穿戴健康数据医学问答推荐理由:这篇论文解决了大模型看不懂可穿戴数据的问题。WEQA框架比基线的准确率高出24%,还通过了医学专家盲测,做医疗AI的同学值得看看。原文稍后读已读值得跟进有用关注 WEQA
10:40官方账号arXiv cs.AI@Ziqi Zhou, Yubo Ye, Sumeet Atul Vadhavka, Linwei Wang, Zhiqiang Tao论文提出LEADS框架,利用LLM智能体在结构化动作空间中迭代发现混合物理-神经模型,解决传统方法需要专家手动设计且无法跨患者迁移的问题。在三种合成反应数据和真实心脏电生理数据上,LEADS均优于人工设计的混合模型和其他基于LLM的方法。该方法保证了模型的物理合理性、可解释性和数值稳定性,同时允许开放性的架构探索。论文LEADS心脏电生理数字孪生推荐理由:这篇论文用LLM智能体自动设计心脏数字孪生的混合模型,比人工靠经验搭的更准,还跨病人管用。合成和真实数据上都赢了其他方法。原文稍后读已读值得跟进有用关注 LEADS
10:17官方账号arXiv cs.LG@SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee论文发现LLM在多项选择问答中早期存在信念漂移,违背鞅性质。通过提出的提示预测重采样(PPR)方法,模型在多次重采样后信念自稳定并收敛。基于此,研究者进一步提出种子答案提示策略和自一致性损失微调方法。在多项选择QA基准测试中,这些方法显著减少信念漂移并提高预测一致性,且不牺牲准确性。论文LLM信念稳定性PPR推荐理由:这篇论文发现了LLM回答重复问题时信念会自己稳定,还给了两种让模型更一致的方法,适合关注推理可靠性的读者。原文稍后读已读值得跟进有用关注 LLM
09:45官方账号arXiv cs.AI@Manon Reusens, Sofie Goethals, David Martens该论文正式提出LLM消费者行为理论,作为分析LLM代理自主消费决策的新领域。作者结合经典与行为经济学及NLP进展,形式化人类偏好如何通过LLM代理反映并聚合为市场需求。论文梳理了关于LLM决策、人类行为模拟和偏好提取的碎片化文献,指出在代理市场中理性与异质性等传统假设可能失效。文章未提供实证验证,而是勾勒研究范围并识别对齐、偏好表示和市场动态等开放问题。论文LLM消费者行为经济学推荐理由:这篇论文把LLM当作消费决策的代理人来研究,从经济学角度提出了一个全新的理论框架,适合想了解人机交互市场动态的读者。原文稍后读已读值得跟进有用关注 LLM
09:41官方账号arXiv cs.AI@Marco Aruta, Vadim Malvone, Aniello Murano, Domenico Parente, Luca Rizzuti研究人员提出一个神经符号框架,将大语言模型(LLM)集成到多智能体系统(MAS)模型检查流程中。LLM作为策略生成预言机,产生的候选策略由标准MAS模型检查器进行形式验证。该生成-认证架构利用LLM引导搜索大型组合策略空间,同时保持形式正确性。框架在NatATL逻辑中实例化,创建了首个包含4211个实例的NatATL策略合成数据集。使用开源Qwen3-32B模型时,认证管道的策略合成准确率达92%。论文LLM多智能体系统策略合成推荐理由:用LLM帮MAS做策略合成,再加形式验证保证正确性,Qwen3-32B跑出92%准确率,挺实在的方法。原文稍后读已读值得跟进有用关注 LLM
09:41官方账号arXiv cs.AI@Mikołaj Zasada, Łukasz Struski, Jacek Tabor, Marcin KurdzielSoftMoE用截断的soft top-k LapSum松弛替换传统稀疏MoE的离散top-k路由,实现专家路由的可微分化。模型参数化每层平均激活专家数并施加全局预算,使容量分配可学习。在语言建模和下游任务上,SoftMoE性能与稀疏MoE相当或更优,但激活专家数量更少。实验显示分配呈高度非均匀性,后层激活更多专家。AI模型SoftMoEMoELLM推荐理由:稀疏MoE的top-k路由不灵活还浪费算力,SoftMoE用可微路由让模型自己学会少用专家,性能却不输,代码开源了。原文稍后读已读值得跟进有用关注 SoftMoE
09:38官方账号arXiv cs.AI@Aueaphum Aueawatthanaphisut, Badri Raj Lamichhane该论文提出一个基于LLM编排的多智能体框架,将大数据即服务生命周期分解为数据摄取、数据清洗、特征工程、AutoML训练、模型评估、MLOps部署、监控和漂移检测等专业智能体。中央LLM编排层协调代理执行、验证中间输出、管理流程上下文并支持动态工作流组合。框架包含共享工件治理、可重复性支持、人在回路检查点和漂移感知反馈循环。在包含缺失值、分类变量、异常值、类别不平衡和模拟协变量漂移的受控表格基准数据集上,与手动ML、仅AutoML和单智能体LLM基线对比,该多智能体BDaaS管道实现了有竞争力的预测性能,并提高了工作流完成率、工件可追溯性、部署就绪度、可重复性和漂移恢复能力。论文LLM多智能体AutoML推荐理由:这篇论文用LLM编排多个专业智能体,自动搞定数据工程到部署监控的全流程,比单智能体和纯AutoML更可靠,适合做生产级自动化参考。原文稍后读已读值得跟进有用关注 LLM
00:01elvis@omarsar0精选OpenClaw-Skill是一种新方法,通过树搜索而非贪心蒸馏来构建代理技能库。该方法分两个迭代阶段,联合生成、识别并组合技能节点,输出结构化的技能树。与传统的扁平化单次启发式技能列表相比,它能更好地实现组合性和覆盖性。该研究基于arXiv论文2606.16774。论文OpenClaw-Skill智能体LLM1 个信源在谈事件专题推荐理由:想给LLM代理搞技能库?OpenClaw-Skill用树搜索取代扁平堆叠,两个阶段搞定组合与覆盖,比贪心蒸馏靠谱。原文稍后读已读值得跟进有用关注 OpenClaw-Skill
12:55官方账号arXiv cs.AI@Sara Fish该研究以EC 2025论文中一个关于公共物品稳定菜单的开放问题为测试平台,评估不同AI研究工作流的效果。实验发现:(1)在提示中加入人类直觉能提升LLM的“品味”;(2)多轮交互工作流在鼓励“大胆步骤”时更有效。与一名一年级博士生比较,LLM在解决该问题上的效果略逊一筹。研究尚未公开博士生参与前的原始手稿对比细节。论文EconCSLLM公共物品推荐理由:这篇论文告诉你,用AI做经济学研究时,喂它人类直觉比纯指令好使,但别指望它比刚入行的博士生强多少。原文稍后读已读值得跟进有用关注 EconCS
12:54官方账号arXiv cs.AI@Truong Thanh Hung Nguyen, Khanh Van Quynh Nguyen, Hoang-Loc Cao, Tri Duong, Phuc Ho, Van Pham, Loc Nguyen, Hung Cao这篇论文提出一种基于共识的智能体大语言模型(LLM)框架,专为加拿大10位HTS代码分类设计。框架集成了多智能体信息检索、官方关税文档的语义检索、证据推理、共识验证、层次化代码组件投票以及人为干预机制。在包含3300条专家标注产品记录的数据集上评估,精确的10位分类对先进LLM仍具挑战性,性能从粗粒度章节级预测到细粒度关税和统计后缀逐步下降。结果表明需要证据驱动、不确定性感知和以人为中心的分类流程,而非完全自主的单步预测。论文HTSLLM智能体推荐理由:这篇论文提出了一个多智能体协作的LLM框架,通过证据推理和共识投票来提升海关HTS代码分类的准确性,特别适合物流合规场景。原文稍后读已读值得跟进有用关注 HTS
12:20官方账号arXiv cs.LG@Violet Xiang, Amrith Setlur, Chase Blagden, Nick Haber, Aviral KumarExpRL提出一种自动化方法,通过基于强化学习的中间训练来提升LLM推理能力。该方法不直接模仿参考解决方案,而是将其作为奖励支架,利用LLM裁判对比策略生成的推理轨迹与参考解,给出稠密奖励。在具有挑战性的数学推理任务上,ExpRL相比SFT、稀疏奖励GRPO和自蒸馏方法,能提供更强的RL初始化和更好的最终性能。此外,混合领域实验表明ExpRL可扩展至数学以外的场景。论文ExpRLLLM强化学习推荐理由:这篇论文用参考答案做奖励支架,让模型自己探索推理路径,数学推理效果超过了SFT和GRPO,想提升推理能力的可以看看。原文稍后读已读值得跟进有用关注 ExpRL
11:46官方账号arXiv cs.AI@Aman Anifer, Vignesh Kumar Kembu, Vishnu M, Antonino Nocera, Vinod P., Amal Murali PK, Akshay S Rajan研究者提出GAS-Leak-LLM,一种基于遗传算法的黑盒LLM越狱攻击方法。该方法无需访问模型参数或内部信息,在严格黑盒设置下通过选择、变异、交叉迭代搜索对抗性后缀。实验在多个主流LLM上验证了攻击成功率,暴露了现有安全对齐机制的缺陷。论文GAS-Leak-LLMLLM遗传算法推荐理由:想看看LLM安全到底有多脆弱吗?这个研究用遗传算法黑盒越狱,效果惊人,开发者应该留意。原文稍后读已读值得跟进有用关注 GAS-Leak-LLM
11:39官方账号arXiv cs.AI@Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair该论文通过300次重复漏洞扫描,测量了LLM在JavaScript代码安全审查中的可重复性。在250次模型运行中,80个唯一不匹配发现仅出现在一次重复中,22个出现在全部五次。相比之下,Claude匹配Snyk Code参考发现时更稳定:134个唯一匹配发现出现在全部五次。Snyk Code SAST是确定性的,能系统枚举重复数据流汇点。结果表明,将agentic LLM审查与确定性SAST结合比单独使用任一方法更好。论文SnykVulnBenchClaude推荐理由:这篇论文测试了LLM重复找漏洞的稳定性,发现Claude匹配结果很稳,但自己新发现的漏洞随机性高。建议和安全工具搭配用,别靠它单干。原文稍后读已读值得跟进有用关注 Snyk
11:13官方账号arXiv cs.LG@Kareem Amin, Rudrajit Das, Alessandro Epasto, Adel Javanmard, Dennis Kraft, Mónica Ribero, Sergei Vassilvitskii该论文提出一个可定制的实证审计框架,用于检测合成数据中的隐私泄露。框架区分“真泄露”(系统直接复制用户信息)与“幻影泄露”(偶然生成用户数据)。通过将数据分为训练集和留出集,并应用统计假设检验,可判断泄露是否超出零学习或差分隐私基线。该方法无需模型访问、无需插入蜜罐、无需训练参考模型,仅需合成输出和留出控制集。实验表明,它作为成员推理攻击,能提供比传统数据审计方法更紧的隐私泄露下限,且计算资源需求少几个数量级。论文合成数据隐私审计差分隐私推荐理由:想审计合成数据是否偷学了你的信息?这篇论文给出了一个轻量级方案,无需模型权限,只需输出和留出集就能揪出隐私泄露。原文稍后读已读值得跟进有用关注 合成数据
11:11官方账号arXiv cs.LG@Naiyu Yin, Dennis Wei, Tian Gao, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy, Yue Yu论文针对LLM电路学习中原始神经元多义性和SAE特征高维度的计算瓶颈,提出基于稀疏线性回归的CircuitLasso方法。在基准数据上,CircuitLasso恢复电路的结构准确性与最先进的干预方法相当,但计算成本大幅降低。它还能高效揭示SAE特征之间的传播关系,展示可解释语义特征如何影响模型预测。在领域泛化任务中,利用CircuitLasso学到的电路洞见,能以更低成本达到可比性能。论文CircuitLassoLLMSAE推荐理由:这篇论文提出了CircuitLasso,能以更低成本达到和现有方法一样好的电路学习效果,还能揭示可解释的语义特征如何传播。原文稍后读已读值得跟进有用关注 CircuitLasso
11:08官方账号arXiv cs.LG@Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Peerat Limkonchotiwat, Sarana Nutanong研究在多个大语言模型上分析了代码解释器推理的外在属性(关键token)和内在属性(代码认知行为)。发现较强模型的关键token和认知行为(验证、回溯、反向链)更突出。推理时添加关键token在数学、排序、优化任务上提升性能。训练时加入认知行为改进了三个模型中的两个的监督微调和强化学习效果。分析显示这些行为能减少错误回答的过度推理并提高token效率。论文代码解释器LLM推理推荐理由:这篇论文分析了代码解释器推理的关键属性和认知行为,发现验证、回溯等能提升数学推理效率,适合关心LLM推理优化的人。原文稍后读已读值得跟进有用关注 代码解释器
11:06官方账号arXiv cs.LG@Frank Zhengqing Wu, Francesco Tonin, Volkan Cevher电路发现是机械可解释性中的关键技术,用于定位执行特定任务的关键模型组件。现有最先进方法EAP-IG在忠信度指标上表现良好,但存在三种方差:重采样方差(用同分布新数据探测时电路变化)、重述方差(提示重新措辞时电路偏移)和样本级方差(低总体不忠信度的电路在单个样本上大幅波动)。本文提出的CEAP方法基于理论保证,能显著减少重采样方差。研究还表明,重述方差源于不同模板激活不同电路,暗示LLM可能本质难以控制。样本级方差主要良性,极差的不忠信度分数常由定义方式或选择性贡献缩放机制导致。论文LLM电路发现机械可解释性推荐理由:这篇论文把电路发现中的方差问题讲透了,还提出了带理论保证的CEAP方法,能减少重采样方差,值得看。原文稍后读已读值得跟进有用关注 LLM
10:33官方账号arXiv cs.LG@Ali Sarabadani, Mahtab TajvidiyanDYNA是一个轻量级框架,通过整合时间知识图来增强冻结的LLM。该图将事件作为节点、时间关系作为带时间戳的有向边,作为外部可更新记忆。在查询时,DYNA通过随机游走和中心性度量检索相关节点,然后增强LLM的响应。在三个时间回忆任务上,DYNA相比微调减少约7%的灾难性遗忘,相比标准RAG提升约5%的时间排序准确性。实验发现,更高的图聚类系数与更好的检索性能相关。论文DYNALLM时间知识图推荐理由:这篇论文提出DYNA,用时间知识图给LLM加外挂记忆,不用重新训练就能减少遗忘,比微调和RAG都更准,适合看重时效性的应用。原文稍后读已读值得跟进有用关注 DYNA
10:03官方一手arXiv: Anthropic@Christian Seto, Jacqueline Nguyen, Jiayi Hong, Ross Maciejewski最新研究测试了Anthropic Claude Opus 4.5、OpenAI GPT 5.2 Pro和Google Gemini 3 Flash在可视化评估上的能力。使用修改后的VLAT测试,发现这三款模型的可视化素养均超过人类平均水平。但在指令遵循方面,few-shot和chain-of-thought提示技术对提升可视化素养已无明显效果。在识别误导性可视化时,无专门提示下模型准确率偏低。结论认为LLM作为可视化评估者的能力仍需重新审视。论文ClaudeGPTGemini10 个信源在谈事件专题推荐理由:这篇论文测了Claude、GPT和Gemini最新版,看图能力比人强,但让它们判断图表有没有骗人,还是不行。有意思的发现。原文稍后读已读值得跟进有用关注 Claude