15:22官方一手arXiv: Anthropic@Nof Orenstein, Yoni Birman本研究针对LLM驱动的社交媒体机器人检测系统,提出了两种新型对抗攻击策略,能将其检测准确率降低高达48%。为应对这些威胁,研究者设计了LSABRE(LLM驱动的社交对抗机器人识别集成)多LLM防御框架,在强自适应对抗压力下仍保持86%的检测准确率。该研究的方法论可推广至钓鱼检测、邮件分类和欺诈分析等更广泛的LLM驱动的网络安全系统。论文LLM社交机器人检测对抗攻击推荐理由:这篇论文讲的是怎么用LLM攻破机器人检测,又怎么用多LLM防住,准确率数字很具体,搞安全或社交平台的朋友值得看看。原文稍后读已读值得跟进有用关注 LLM
10:16官方账号arXiv cs.LG@Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel MarksCHIVE是一个基于智能体的pipeline,通过反事实提示编辑自动发现并研究LLM在自然场景中的意外行为,生成数千条附带反事实证据的高质量解释。研究人员用它评估多种常见可解释性技术,发现这些技术并未提升代理预测反事实行为的能力。此外,用CHIVE生成的数据训练模型预测反事实结果,能够泛化到多种分布外设置。论文表明CHIVE可自动发现自然发生的LLM行为解释,并为评估和改进解释方法提供新途径。论文CHIVELLM可解释性推荐理由:这篇论文搞了个CHIVE自动找模型意外行为,结果发现现有可解释性技术对预测反事实行为没啥用,但用来训练数据倒挺能泛化,值得做可解释性的人看看。原文稍后读已读值得跟进有用关注 CHIVE
10:16官方账号arXiv cs.LG@Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison论文提出两种互补策略改进价值函数强化学习:特权价值函数(PVF)在不偏置策略目标的前提下注入额外token级信号;TETHER则根据价值函数准确性自适应地在组相对基线和价值基线之间插值。在多个推理任务上,这两种策略均稳定优于标准价值函数基线,并与平均基线GRPO相比具有竞争力或更优。论文LLMGRPO强化学习推荐理由:这论文提了两个新招PVF和TETHER,给LLM强化学习用的,比标准价值函数强,和GRPO差不多甚至更好,搞RL的可以看看。原文稍后读已读值得跟进有用关注 LLM
00:41techcrunch@Amanda SilberlingAmazon被曝销毁稀有书籍,以获取独有内容训练AI模型。由于LLM已充分学习公开网络数据,这类纸质书成为稀缺训练来源。截至报道发布,Amazon未公布销毁的具体数量与书目清单。行业AmazonLLMAI训练数据推荐理由:想知道AI数据有多缺?Amazon为了训练LLM,连稀有书都直接销毁了。原文稍后读已读值得跟进有用关注 Amazon
10:31官方账号arXiv cs.AI@Masahiro Kato, Taka Kato该论文将跨会话信息传递形式化为任务相关的上下文学习(ICL)状态交接,并区分了精确恢复早期材料与保留目标分布。在外生性条件下,预测等价性刻画了最粗的确定性充分交接,并给出固定长度的比特需求。作者提出三部分记录:精确存储决策与约束,用任务论证的统计量保存重复证据,并保留未被统计量覆盖的原始观察。高斯线性回归得到精确的有限维交接和有限比特扰动界,非参数回归则给出记忆与平方预测误差之间的上下界。论文上下文学习会话交接LLM推荐理由:这篇论文把跨会话交接讲透了,给出最小充分交接的比特需求和高斯线性回归的精确结果。做长会话AI应用的值得看看。原文稍后读已读值得跟进有用关注 上下文学习
02:42Suhail@Suhail一条帖文吐槽 AI 行业的“网关化”正在失控:vibe coding 先催生 50 家公司,随后有人做提供 LLM、Sandbox 等能力的 gateway 公司。这类 gateway 公司又很快超过 50 家,于是创业者开始做“gateway 的 gateway”,形成层层套娃。作者形容这种递归结构已经“out of control”,是当前 AI 创业生态的缩影。行业vibe codingLLMSandbox推荐理由:这吐槽太精准:vibe coding 带来 50 家公司,衍生出网关公司,现在网关的网关都有人做。看完就懂。原文稍后读已读值得跟进有用关注 vibe coding
23:53官方账号Decoder@Matthias Bastian数学家Timothy Gowers和Peter Sarnak指出,LLM擅长组合已知的数学方法,但在提出全新数学思想上缺乏直觉。他们认为LLM更像是强计算器,而非创造性思考者。两位专家还表示,模型无法真正理解数学中的深层结构。行业LLM数学推理Timothy Gowers推荐理由:两位数学大牛说,LLM只会拼凑已有套路,想不出新数学,想靠它搞原创研究得小心。原文稍后读已读值得跟进有用关注 LLM
21:13Gary Marcus@GaryMarcus精选Gary Marcus在X上回应Florian Tramèr的推文,指出神经符号AI的定义并未改变。他认为只要同时使用条件判断、变量操作、代码解释器等符号操作和神经网络,就属于神经符号系统。Marcus强调自2001年以来他一直在阐述这一定义,只是近年来的实践发生了变化。他宣称过去三年神经符号方法已经获胜。AI模型Gary Marcus神经符号LLM推荐理由:Gary Marcus直接反驳'有效就是神经符号'的说法,坚持按符号操作来定义。搞不清神经符号是啥的看这条。原文稍后读已读值得跟进有用关注 Gary Marcus
06:02官方账号Simon Willison’s Weblog(博客/媒体)精选Simon Willison的博客有1,856个标签,直接让LLM从中挑选匹配项容易超限。Doug Turnbull提出先让模型自由生成标签,再通过向量嵌入在现有标签库中查找最接近的具体标签。示例提示词展示了如何用家具分类层级结构来引导模型生成形状合理的候选标签。这样既能利用模型对语义的理解,又能保证最终标签来自既定词表。技巧LLM向量嵌入标签生成推荐理由:给老博客补标签别硬分类——先让LLM随便编,再用向量嵌入找最接近的现有标签。Simon Willison分享的这套路,比直接要模型选1856个标签里的一个靠谱。原文稍后读已读值得跟进有用关注 LLM
12:02官方账号arXiv cs.AI@Dananjay Srinivas, Saksham Khatwani, Maria Pacheco这篇论文受格莱斯合作原则启发,提出LLM在遇到未知实体时应从具体表述撤退到更安全的泛化表述。作者基于T-REx构建基准,改变实体熟悉度和指称特异性,探测模型内部激活是否编码了知识边界和待生成指称的特异性。结果显示两种信号都存在,但生成时模型仍偏好具体指称,即使提供正确的泛化选项也如此。这表明实现Gricean退避所需的基本表征已具备,但缺少将其转化为生成策略的机制。论文T-RExLLM知识边界推荐理由:这篇用探针方法拆开了LLM一本正经胡说八道的原因:模型内部其实知道自己不知道,但嘴硬不肯说泛话。原文稍后读已读值得跟进有用关注 T-REx
11:58官方账号arXiv cs.AI@Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi精选AaLLM 是一个开源的端到端多智能体 LLM 工作流,输入规格即可输出网表,同时覆盖拓扑生成和电路尺寸确定。它从论文和教科书中自动构建知识库,并采用 RAG 模型模拟电路设计专家知识。AaLLM 使用设计师、评论家和评估器组成的三智能体反馈系统,减少尺寸迭代次数。生成的创新拓扑在品质因数上与已知拓扑相当,部分电路高出 3 倍。与最先进的多智能体 LLM 管线相比,SPICE 调用次数减少 3-4.5 倍,墙钟时间减少 40 倍。论文AaLLM模拟电路设计RAG推荐理由:想用 LLM 做模拟电路设计的话,AaLLM 是开源端到端方案,给规格直接出网表,SPICE 调用和耗时都比现有方法少一个数量级。原文稍后读已读值得跟进有用关注 AaLLM
10:30官方一手arXiv: OpenAI@Jim Woodcock, Gabriel Leite, Augusto Sampaio, Ran WeiCAPRI 是一种面向 Isabelle 证明的契约感知修复工作流,由 Isabelle 检查证明,独立检查器执行机器可读的编辑契约。研究在四个开发项目的十二个失败证明上评估了五种工作流,每任务三份复现,共 180 次运行和 138 次有效修复。其中 144 个被 Isabelle 接受的候选修复有六个修改了受保护文本,均来自可编辑完整理论的迭代工作流。仅限证明体的接口得到 29/36 个有效修复且无契约违规,而对应完整理论工作流为 31/36。论文CAPRIIsabelleLLM推荐理由:这论文搞了个 CAPRI 工具,管 LLM 改 Isabelle 证明,能查它有没有动不该动的地方。12 个失败证明跑 180 次,修复率直观看得很清楚,想用 LLM 做形式化证明的可以看看。原文稍后读已读值得跟进有用关注 CAPRI
17:43官方账号arXiv cs.AI@Saman Marandi, Yu-Shu Hu, Mohammad Modarres该研究提出利用检索增强生成和大语言模型,从系统描述中自动构建动态主逻辑模型,并表示为知识图谱(KG-DML)。方法沿DML层级进行定向检索,保留功能依赖和显式逻辑关系,支持故障向上传播和向下依赖追踪。验证应用于一座退役沸水反应堆的低压冷却剂注入系统,重复运行结果一致。多级评估覆盖各层精度、召回率、逻辑门一致性与结构完整性,证明自动化构建可将技术文档转为可用于诊断和可靠性分析的可执行功能模型。论文DML知识图谱RAG推荐理由:这篇论文讲怎么用RAG和LLM把技术文档自动变成知识图谱,用在反应堆诊断上,跑得还稳,搞可靠性的可以看看。原文稍后读已读值得跟进有用关注 DML
18:42官方一手arXiv: DeepSeek@Linhao Wu, Yizhou Chen, Zhen Yang, Pengyu Xue, Dan HaoCausalRepair是一个基于对话的自动程序修复框架,通过双切片策略构建最小因果上下文。静态切片净化测试语义,动态切片基于执行轨迹捕获精确运行时依赖。在Defects4J V1.2、V2.0和Defects4J-Trans上使用DeepSeek-V3评估,正确修复313个缺陷,优于ReinFix和TSAPR,平均修复成本降至0.029美元。论文CausalRepairDeepSeek-V3Defects4J推荐理由:想搞LLM自动修bug的可以看看,CausalRepair用双切片把上下文搞干净了,修复数比ReinFix多,成本还低。原文稍后读已读值得跟进有用关注 CausalRepair
18:33官方账号arXiv cs.LG@Nikolai Bolik, Lennart Stöpler, Artur AndrzejakShani等人2026年的研究显示LLM表征能大致还原人类类别边界,但无法捕捉细粒度典型性结构。本文用稀疏自编码器(SAE)活跃潜变量集的重叠度作为更可解释的相似度度量,重新审视该分析。在受控玩具模型中SAE潜变量集能恢复并集式组合结构,在自然文本中也能诱导语义连贯的邻域。但扩展到人类概念分析时,SAE激活集并未比稠密嵌入或残差流状态更忠实还原类别边界或典型性,而是追踪模型内部相似性结构。在受控语义修改下,人类概念变化判断与SAE活跃集变化存在显著不匹配,说明在理想化设置之外SAE特征不按简单词袋语义组合。论文稀疏自编码器SAE可解释性推荐理由:这篇论文用SAE潜变量集做相似度度量,发现它并不比稠密嵌入更贴近人类概念判断,搞可解释性的人值得看看这个反直觉结论。原文稍后读已读值得跟进有用关注 稀疏自编码器
18:10官方账号arXiv cs.LG@He-Yen Hsieh, H. T. KungReRound是一种后训练量化方法,针对标准RTN在量化接近区间中点的权重时固有的中点模糊性问题。它训练一个条件扩散模型生成低比特权重的连续重建,作为确定舍入方向的引导信号。ReRound引入容差度量,对中点附近权重用扩散重建,对边界附近权重用RTN,并通过扫描容差参数选择与原始全精度权重奇异值最匹配的候选。在3比特和4比特量化下,ReRound在小型LLM上持续优于RTN,且精度超过多种无校准方法,与依赖校准的方法相当,推理时无额外开销。该方法适用于LLM之外的AI模型,论文聚焦于小型LLM。论文ReRound量化扩散模型推荐理由:如果你在做低比特量化,ReRound用扩散模型解决RTN的中点模糊,3/4比特下比RTN更准,还不用校准数据,值得看看。原文稍后读已读值得跟进有用关注 ReRound
17:49官方账号arXiv cs.AI@Nicola Giuseppe Marchioro, Gabriele Padovani, Amal Gueroudji, Rafael Ferreira da Silva, Wesley Brewer, Valentine Anantharaj, Sandro Fiore, Renan SouzaWorkflow Cards是一种新文档形式,将工作流执行的机器可读溯源数据压缩为人类和LLM可读的结构化摘要。论文定义了基于溯源问题集的Workflow Card模板,并评估LLM使用其理解工作流执行的效果。结果显示,Workflow Cards提供了Model Cards和Data Cards缺失的执行级信息,填补了文档空白。与基于schema的查询相比,Workflow Cards在LLM-as-a-Judge和人工评估中答案质量几乎翻倍。论文Workflow Cards溯源数据LLM推荐理由:论文提出Workflow Cards,把工作流执行记录变成人和AI都能读的摘要,比直接查数据库答案质量高一倍,做AI文档的可以看看。原文稍后读已读值得跟进有用关注 Workflow Cards
08:28官方账号Simon Willison’s Weblog(博客/媒体)精选Sophie Alpert分享了她对工程师使用AI写作的内部政策,强调文档中的每个想法和句子都必须由作者负责。她指出,自然语言文本不存在无损转换,任何重写或改写都会改变原意。如果AI没有作者最详细的意图表征,信息就会丢失。政策建议作者在分享前确保整个文档代表自己的思想,不能以“AI写的”为借口推卸责任。技巧AI写作工程师内部政策推荐理由:Sophie Alpert这篇短文讲工程师用AI写作的底线,核心是“每个句子都得你负责”,对写文档的人很有参考价值。原文稍后读已读值得跟进有用关注 AI写作
12:47官方账号arXiv cs.LG@Lecheng Kong, Like Hui, Haitao Mao, Jun Huan论文指出基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上会崩溃,因为高置信度常表示探索失败。作者提出Consilience框架,通过评估推理中置信度的时间不对称性,惩罚初始高置信度并要求最终确定性。在研究生级数学问题和自由形式代码生成实验中,Consilience优于现有基线。论文Consilience测试时扩展推理模型推荐理由:如果你做推理模型,这个框架能解决置信度评分在复杂任务上失效的问题,用时间不对称性挑出真正靠谱的答案。原文稍后读已读值得跟进有用关注 Consilience
11:26官方账号arXiv cs.AI@Ghanshyam Verma, Simanta Sarkar, Devishree Pillai, Hotaka Shiokawa, Yourong Xu, Fiona Veazey, Peter Hubbert, Hui Su, Paul BuitelaarKGCaRe是一种混合方法,结合神经检索与符号推理,通过多提示提取策略从文档构建知识图谱并存入图数据库,同时将文档嵌入向量库。它采用LLM引导的迭代图遍历提取相关三元组,并在初始遍历不足时利用线索实体再次遍历。在Mistral、Mixtral、GPT-3.5和GPT-4o等多个LLM上,KGCaRe在两个复杂条件问答数据集上持续优于Vanilla LLM、Vanilla RAG、Think-on-Graph等基线。该方法已公开软件管道。论文KGCaRe知识图谱RAG推荐理由:KGCaRe把知识图谱和RAG结合,复杂条件问答比普通RAG更准,多个模型上都赢了,代码也开源了。原文稍后读已读值得跟进有用关注 KGCaRe
11:17官方账号arXiv cs.AI@Hasan Mahmud, Khawaja Abaid Ullah, Mohammad Javad Khojasteh, Jamison Heard, Prabu David该论文检验了LLM作为社交评判者的有效性,基于10个心理和关系构念构建了3层人格画像(社交吸引、混合、不吸引)。研究1中,34个LLM对12个画像进行3次重复评分,表现出高稳定性和一致的3层排序。研究2通过6对匹配姓名和代词及仅代词测试,未发现性别呈现的显著影响。研究3中198名人类参与者的评分复现了3层结构,但LLM对吸引画像评分更积极、对不吸引画像更消极。论文LLM社交吸引力人格画像推荐理由:想知道AI能不能当靠谱的社交裁判?这篇用34个模型和198个人类实测对比,结论挺有意思。原文稍后读已读值得跟进有用关注 LLM
11:15官方账号arXiv cs.AI@Kevin MurphyModel Discovery Agent (MDA) 将大语言模型作为候选结构提议器,与序贯蒙特卡洛、模拟推断和价值信息等贝叶斯方法结合,用于从少量干预实验中学习因果机制模型。MDA 在 M-open 设定下运行,当真实模型超出假设类时,预测检查会触发提议器扩展假设空间。在物理、化学和生物学三个基准上,MDA 实现了数据高效的模型学习和可靠的干预预测,创下新 SOTA。论文Model Discovery Agent贝叶斯实验设计因果模型推荐理由:想用最少实验搞清楚因果机制?MDA 把 LLM 和贝叶斯结合,自动设计实验、发现模型,物理化学生物三领域都刷新了纪录。原文稍后读已读值得跟进有用关注 Model Discovery Agent
11:01官方账号arXiv cs.LG@Aaron Haag, Altay Kaçan, Bertram Fuchs, Oliver Lohse本文提出一种无需验证器的3D CAD生成测试时扩展方法,称为共识选择。该方法从候选池中采样N个参数化CAD程序,编译为3D模型后,选择与池中其余候选最一致的那个。几何共识在三个几何指标上优于现有方法的验证器,拓扑共识在拓扑指标上与之持平。在多种LLM和提示变体下,几何共识比随机选择降低1-10%的Chamfer距离。论文CAD生成共识选择测试时扩展推荐理由:不用额外验证器,靠候选池内部共识就能挑出好CAD模型,几何指标还更准,省事又有效。原文稍后读已读值得跟进有用关注 CAD生成
10:46官方一手arXiv: DeepSeek@Abdalla Doleh, Toni Somers, Ratna Babu Chinnam该研究开发了一个自动化流程,用大语言模型生成结构化决策场景,并通过基于任务复杂度理论的复合框架验证其复杂度。研究评估了4,238个场景,五个独立模型家族的一致性近乎完美,组内相关系数达0.997,kappa值为0.971。已知组效度显示各复杂度层级间分离明显,eta-squared为0.587,所有配对比较p值小于0.001。因子分析显示一个主导的复杂度构念,载荷在0.87到0.96之间,交互性构成较弱的次要维度。Llama 4 Maverick生成速度最快,每分钟134个场景,而DeepSeek Chat V3.2在领域覆盖和模式合规性上更均衡。论文LLM决策场景复杂度验证推荐理由:这篇论文讲怎么用LLM自动造认知决策场景,还验证了复杂度靠谱,做AI评估或心理学实验的可以看看。原文稍后读已读值得跟进有用关注 LLM
10:27官方账号arXiv cs.AI@Rodrigo Ferreira Rodrigues, Karim Radouane, Jose G Moreno, Lynda TamineGeoBenchLLM是一个评估大语言模型地理相关任务能力的基准,整合了12个公开数据集。该基准覆盖地理空间和时间理解两类任务,测试了多个主流LLM。结果显示,推理能力和模型尺寸对整体性能影响显著。基准代码已在GitHub公开。论文GeoBenchLLMLLM地理空间推荐理由:想测LLM的地理常识?这个新基准GeoBenchLLM用12个数据集考了主流模型,结论是模型越大、推理越强,GitHub上可跑。原文稍后读已读值得跟进有用关注 GeoBenchLLM
08:02Gary Marcus@GaryMarcusGary Marcus在X平台转发Luca Ambrogioni的推文,表示认同其观点。Luca认为LLM存在被推理和智能体流水线进展掩盖的根本性缺陷。该推文目前获得13次点赞、5条回复和2424次浏览。行业LLMGary Marcus推理模型推荐理由:Gary Marcus转推吐槽LLM有根本硬伤,被推理和智能体流水线盖住了,观点挺犀利,看看你认不认。原文稍后读已读值得跟进有用关注 LLM
06:50官方账号Yann LeCun@ylecunLeCun在推文中指出,长期研究常被追求短期效益的公司管理层视为浪费时间。他认为,若相信AGI靠LLM scaling就能实现,则研究世界模型等新概念会被看作徒劳。LeCun与Demis认为AGI还需要更多概念性突破,因此他选择更贴近研究、远离产品管理的角色。他始终支持高质量LLM研究,但强调LLM只是有用技术,不是人类级AI的最终答案。行业LeCun世界模型AGI推荐理由:LeCun出来聊长期研究和LLM了,说AGI还得靠新概念,他看好世界模型,跟主流scaling路线唱反调。原文稍后读已读值得跟进有用关注 LeCun
01:02官方账号Simon Willison@simonw精选404media《The Tokenpocalypse》披露,埃森哲的Token支出里有相当一块来自非工程师。这批人用LLM把PDF转成Markdown,也在消耗Token。Simon Willison在X上转述说,企业Token开销的构成比想象中更基础。行业AccentureLLMPDF转Markdown推荐理由:埃森哲的Token开销大头居然是非工程师拿LLM转PDF成Markdown,跟想象的企业AI场景不一样。原文稍后读已读值得跟进有用关注 Accenture
12:05官方账号arXiv cs.AI@Donna Hooshmand, Shubham Shahi, Cameron Barrie, Abhratanu Dutta, Marko Sterbentz, Harper Pack, Kristian J. HammondTYTAN是一个从关系数据库自动构建分析语义模式的系统,结合符号分析和LLM推理来提出实体、分配角色并命名。在八个数据库的评估中,TYTAN在七个参考域上达到100%的实体与特征覆盖率。其1,678条自生成检索指令全部正确执行,语义角色在92-100%的匹配属性上与参考一致。在一张无声明键的十表实时数据库盲测中,TYTAN恢复了完整实体结构并满足五位独立标注者100%的可满足期望。论文TYTAN语义模式关系数据库推荐理由:TYTAN这篇论文教系统自动看懂数据库结构,不用手写语义层,测试里百分之百跑通,挺实在。原文稍后读已读值得跟进有用关注 TYTAN
10:43官方一手Pandaily@contact@pandaily.com (Pandaily)文章指出,中国出口的'新新三样'已变为机器人、AI模型和创新药物。澳大利亚出现了中国制造的爬墙清洁机器人,巴西电网则采用中国大语言模型运行。澳大利亚与巴西的案例表明,中国出口的这三个领域正在改变海外印象。行业机器人AI模型创新药物推荐理由:这篇讲的是中国出口的新花样:机器人、AI模型和药物,连巴西电网都在用中国LLM,有意思。原文稍后读已读值得跟进有用关注 机器人
09:40官方账号arXiv cs.AI@Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie论文提出MicroEvo框架,将现成LLM与蒙特卡洛树搜索(MCTS)结合用于多目标微架构优化。该框架包含LLM驱动的进化算子、Pareto感知树策略、主动知识积累机制和状态感知指令。实验显示,MicroEvo相比NSGA-II将Pareto前沿质量最高提升36.2%,搜索效率提升10.6倍。该方法在复杂工业级核心上展现出强可扩展性,代码已在GitHub开源。论文MicroEvoMCTSLLM推荐理由:MicroEvo用LLM引导芯片微架构设计搜索,比NSGA-II质量高36.2%,效率提升10倍多,代码已开源。原文稍后读已读值得跟进有用关注 MicroEvo
09:18官方账号arXiv cs.AI@Thomas H. Costello, Nathaniel Rabb, Michael Nicholas Stagnaro, Gordon Pennycook, David Rand在2024年7月特朗普刺杀未遂和2025年9月Charlie Kirk刺杀事件后,美国成年人(实验1 N=472,实验2 N=1035)与LLM进行多轮对话,其阴谋论信念相比对照组显著下降。对照组分别与LLM讨论无关话题或查看静态事实表。干预效果在1至2个月后的后续危机事件中仍可观测到,对不同阴谋论的信念同样降低。研究提示,基于LLM的对话干预能在重大事件后即时抑制错误信息。论文LLM阴谋论错误信息推荐理由:这篇论文让LLM当对话对手,跟人聊几轮就能把阴谋论信念聊下来,比干看事实清单管用,效果还能延续一两个月。原文稍后读已读值得跟进有用关注 LLM
08:10Paul Graham@paulgPaul Graham在X上发帖(17238次查看)称,用更抽象的语言编写代码能降低LLM生成时的token成本。他认为LLM并不排斥前缀表示法,这也是抽象语言值得尝试的原因(该帖有35条评论)。这条推文获得161个赞、6次转发和42次分享。技巧Paul GrahamLLMtoken成本推荐理由:Paul Graham说,想让LLM写代码更省token,就换更抽象的语言,连前缀表示法它也不怕。原文稍后读已读值得跟进有用关注 Paul Graham
03:16Gary Marcus@GaryMarcus精选Gary Marcus在X平台驳斥了一个热门类比,该类比将LLM比作“缸中之脑”。有人以ARC-AGI 3为例提问,若大脑不接身体是否还能完成该测试,并认为加装工具等同于拥有身体。Marcus认为此类比不成立,因为人类智力依赖的是前额叶皮层这一关键脑区。他强调harness应当是大脑自身的组成部分,而非外部附加的传感器或肢体。行业GaryMarcusARC-AGILLM推荐理由:Gary Marcus怼了个流行类比:别把LLM当缸中脑,人的智力靠前额叶,不是靠身体。看看他咋说的。原文稍后读已读值得跟进有用关注 GaryMarcus
12:01官方账号arXiv cs.AI@Johann Knechtel, Ozgur Sinanoglu, Paul V. Gratz, Ramesh Karri这篇论文统一分析了 chiplet 与 LLM 时代硬件攻击面的扩展,覆盖架构、逻辑和物理三个层面。针对 2.5D chiplet 系统,论文提出利用 2.5D split manufacturing 和 active interposers 构建物理隔离的 Root of Trust 防御架构。针对 LLM 驱动的 EDA 流水线,论文识别了原生威胁并梳理了现有防御技术。论文还探讨了 LLM 系统如何用于增强 chiplet 等现代系统的硬件安全。论文chipletLLMEDA推荐理由:这篇论文把 chiplet 和 LLM 两个热点合在一起聊硬件安全,既有攻击面分析也有防御方案,做芯片安全的值得看看。原文稍后读已读值得跟进有用关注 chiplet
10:00官方账号arXiv cs.AI@Shaopeng Liang该论文提出一个可审计的LLM信息管道,将动态Dixon-Coles统计模型与LLM情境推理结合,用于足球精确比分预测。论文记录了V1到V4四次迭代:V1为Dixon-Coles基线,V2将LLM评级映射到预期进球参数,V3用逐球模拟替代标量修正,V4加入首破门与后续级联判断。在2025-26英超前150场比赛的时间回放中,V1的Top-1精确比分准确率为10.0%,Top-3为26.7%;V4提升至14.7%和30.7%,候选覆盖率从77.3%增至84.7%。V1的原生1X2分布的argmax准确率为53.3%,对数损失0.9878,Brier分数0.5870。结果属于探索性,开发切片并非未触碰的基准,且时间输入隔离无法排除封闭LLM中的结果记忆。论文Dixon-ColesLLM足球比分预测推荐理由:用LLM预测足球比分?论文把Dixon-Coles和LLM结合成可审计管道,英超前150场Top-3精确率从26.7%提到30.7%,还说了哪里没用。原文稍后读已读值得跟进有用关注 Dixon-Coles
09:53官方账号arXiv cs.AI@Isaiah Andrews这篇论文把决策论中的表示定理用于AI评估:检查模型行为是否满足公理,不需要外部标签或人类反馈。作者用德菲内蒂定理做概率一致性检验、用阿夫里亚特定理检验偏好理性、用Echenique和Saito(2015)定理检验主观期望效用。每个检验都给出连续惩罚项,当行为可被理性化时惩罚为零。由于公理是充要条件,通过检验的模型在理性标准下无法被同一数据上的其他测试拒绝。这些惩罚不限制具体目标函数,因此可与其他评估和训练信号互补。论文LLM无标签评估表示定理推荐理由:想不靠人工标注就给模型打分?这篇论文用数学定理把理性检验变成可计算惩罚,还给了三个现成公式。原文稍后读已读值得跟进有用关注 LLM
01:48AK@_akhaliq精选MerchantBench 是一个专门评测 LLM 智能体在电商运营中长期连贯性的新基准。MerchantBench 包含跨多轮任务的测试场景,用于检验智能体在长时间运营中的记忆与决策一致性。论文全文已发布在 Hugging Face 平台上。论文MerchantBenchLLM智能体推荐理由:MerchantBench 专门测 LLM 智能体在电商里的长期连贯性,比单轮问答更贴近实际运营,可以看看。原文稍后读已读值得跟进有用关注 MerchantBench
23:09Suhail@SuhailSuhail 在 X 上提问:哪些公开可用的 LLM 基准测试足够可信,能展现模型之间的真实差距?截至当前,这条帖子有 4 条回复、1 次转发、3 个赞和 1777 次查看,另有 4 次收藏。提问未限定具体基准,而是希望获得社区认可的评测标准,以避开厂商自报成绩的干扰。行业SuhailXLLM推荐理由:有人问哪些公开基准能看出模型真实差距,帖子下已有回复在讨论,想看别人怎么选评测可以参考。原文稍后读已读值得跟进有用关注 Suhail
12:28官方账号arXiv cs.AI@Hailong Jiang, Feng Yu, Emran Hossain, Jianfeng Zhu, Mengfei Ren, Qiang Guan, Chunwei XiaSeGaBench 包含 100 个合成用例和 20 个真实源码用例,覆盖底层假设、数据结构不变式和高层语义提升。研究评估了五个大语言模型,每个用例取五次独立响应。最强模型在 94.8% 的响应中生成正确工件,83.3% 的响应实现至少 1.05 倍加速,在 93.3% 的用例上获得性能成功。结果表明 LLM 可作为推测性语义提议者,但生成工件仍需验证。论文SeGaBenchLLM编译器优化推荐理由:编译器漏掉的优化,LLM 能补上?SeGaBench 测出最强模型在 93% 用例上拿到性能提升,挺有意思。原文稍后读已读值得跟进有用关注 SeGaBench