09:21Jerry Liu@jerryjliu0LlamaIndex 创始人 Jerry Liu 在推文中赞同一种观点:企业利用数据的核心不在于训练模型,而在于将数据转化为模型可在推理时通过上下文使用的技能或工件。他指出训练模型耗时费力且需随基模型更新重复,且难以撤销。相比之下,通过提示词和编排利用模型推理时的易用性是 LLM 流行的部分原因。行业LlamaIndexLLM上下文学习推荐理由:LlamaIndex 创始人聊数据策略:别费劲训练模型,把数据做成上下文技能更划算。原文稍后读已读值得跟进有用关注 LlamaIndex
09:18官方账号arXiv cs.LG@Fabrizio Marozzo, Stefano Iannicelli该论文提出一种用大语言模型进行观点摘要的框架,结合多维分类(如情感、主题)和分层采样策略,先在Amazon产品评论、Tripadvisor酒店评论和X/Twitter帖子等数据集上筛选出紧凑且有代表性的意见子集,再通过定制提示生成平衡摘要。实验表明,该方法在保持语义的同时显著降低了Token使用量和计算成本,在内容覆盖、平衡性和语义保留上一致优于传统AI和标准LLM摘要基线。论文LLM观点摘要语义保留推荐理由:这篇论文找到了一个用LLM做观点摘要的新路子,能省下不少token,还能保留不同人的真实观点,比常规摘要方法更靠谱。原文稍后读已读值得跟进有用关注 LLM
09:12官方账号arXiv cs.LG@Shrestha Datta, Hongfu Liu, Anshuman Chhabra论文提出Weight-Adjusted Gradients方法,通过捕获权重与一阶梯度的交互来估计参数重要性。在GPT-2、Llama-2等模型上,WAG发现仅占0.3%的关键参数,修改它们会导致性能下降超过40%,而现有幅度剪枝准则遗漏了这一失效模式。该方法在混合专家模型分配、参数级遗忘、混合精度量化和知识编辑层选择等四类应用中展示了有效性。实验表明WAG统一了零阶与一阶信息,为分析、调试和控制LLM提供了新工具。论文WAGLLM参数重要性推荐理由:这篇论文提出了WAG方法,能精准定位LLM中那些一旦改动就会崩掉的关键参数,比传统重要性指标更灵敏,还顺手解决了专家分配、遗忘、量化等实际问题。原文稍后读已读值得跟进有用关注 WAG
02:15Jerry Liu@jerryjliu0精选Skyfall AI推出Morpheus,首个不重置的持久企业模拟平台,用于评估模型在真实动态环境中的持续学习能力。现有RL基准如Atari、OpenAI Gym、MuJoCo、Procgen均为游戏世界,每几分钟重置一次。团队测试了前沿LLM在Morpheus上的表现,结论是LLM不是持续学习者。AI产品MorpheusSkyfall AILLM10 个信源在谈事件专题推荐理由:Skyfall AI搞了个叫Morpheus的模拟环境,永不重置,专门测LLM能不能持续学习,结果发现它们根本不行。原文稍后读已读值得跟进有用关注 Morpheus
00:09shao__meng@shao__meng精选语音AI demo由STT→LLM→TTS组成,但生产系统需解决低延迟音频流、轮次检测、打断处理等编排问题。文章要求亚秒级往返延迟(STT+LLM+TTS+电话层≤1秒)、知识库有依据回答、实时上下文注入、转人工干净、不拨号可测试。方案用Telnyx AI Assistant Builder吸收管线,开发者仅写约15行FastAPI webhook。通过静态Instructions和Dynamic Variables拼接prompt,支持门户浏览器、真实PSTN号码、WebRTC三种测试方式。技巧TelnyxSTTLLM推荐理由:想搞生产级语音Agent?这篇拆了Telnyx的实战方案,15行webhook搞定上下文注入,还讲清了低延迟和测试细节。原文稍后读已读值得跟进有用关注 Telnyx
13:03Geek@geekbb一个Python玩具项目通过模拟神经化学浓度来生成机器人情绪。用户输入文字后,LLM将其转化为化学脉冲,进而驱动一块8x8 LED点阵脸做出对应表情。项目代码已开源在GitHub。技巧PythonLLMLED点阵推荐理由:用LLM把文字变化学脉冲,再让LED脸演情绪,创意满分,开源可玩。原文稍后读已读值得跟进有用关注 Python
11:38官方账号arXiv cs.LG@Kangwei Xu, Bing Li, Ulf Schlichtmann这篇论文讨论了LLM在电子设计自动化(EDA)前端设计中的应用,指出其可在HDL生成、测试台构建和设计空间探索等任务中作为统一接口。文章回顾了从局部辅助到自主代理执行的演变,并介绍了OpenClaw等先驱系统。还分析了LLM在电路生成和高级综合中提升设计质量的现有进展。最后,论文总结了集成LLM的关键挑战和未来机遇。论文LLMEDA芯片设计3 个信源在谈事件专题推荐理由:这篇论文系统梳理了LLM在芯片前端设计中的应用,从HDL生成到设计空间探索,还介绍了OpenClaw等代理AI方案,适合关注EDA与AI结合的读者。原文稍后读已读值得跟进有用关注 LLM
10:49官方账号arXiv cs.AI@Katherine Swinea, Kshitiz Aryal, Lopamudra Praharaj, Maanak Gupta论文提出VEXAIoT,一个基于LLM的多智能体框架,包含漏洞检测代理和攻击执行代理,用于自主发现和利用IoT环境中的漏洞。在IoTGoat和Metasploitable2的10个OWASP IoT攻击场景中测试,单次攻击成功率高达100%,平均执行时间低于2分钟。在总共260次攻击执行中,整体成功率为95.0%,其中IoTGoat环境94.5%,Metasploitable2环境96.7%。结果表明LLM驱动的代理可自动化IoT漏洞评估和渗透测试。论文VEXAIoTLLMIoTGoat推荐理由:用LLM代理自动挖IoT漏洞,成功率95%,两分钟一个攻击,省时省力。原文稍后读已读值得跟进有用关注 VEXAIoT
10:28官方账号arXiv cs.AI@Kiran Pala, Punam Silu, Lixun Yu该论文提出一个基于特征图的可解释框架,用于表示八种语言共160个习语的传统意义。每个习语通过二进制概念特征(如包含、隐藏、情感、社会等)进行标注,并使用Jaccard相似度构建加权图。社区检测显示习语按概念模式聚类而非按语言聚类,其结构符合认知语言学预测。该概念网络捕获了分布式嵌入中不存在的独特语义信息,可通过LLM自动标注扩展,并提升下游习语检测性能。跨语言迁移实验表明,仅凭概念相似性即可识别五种语系中的可接受翻译等价物,相比基于嵌入的基线有显著提升。论文习语表达跨语言概念网络推荐理由:这篇论文用图网络和概念特征来分析八种语言里的习语,发现它们按语义模式聚类而不是语言,还能用LLM自动标注,对做跨语言NLP和理解习语很有用。原文稍后读已读值得跟进有用关注 习语表达
09:56官方账号arXiv cs.AI@Chongyu Qu, Can Cui, Zhengyi Lu, Junchao Zhu, Tianyuan Yao, Junlin Guo, Juming Xiong, Yanfan Zhu, Yuechen Yang, Bennett A. Landman, Yuankai HuoSAGEAgent是一种基于LLM的临床智能体,能自主决定为每位癌症患者获取哪些诊断模态,平衡预测准确性与临床侵入性。它通过临床工具、情景记忆和语义记忆推理患者的诊断状态。在包含TCGA-LGG、TCGA-GBM和BraTS的胶质瘤队列中,使用四种诊断模态,SAGEAgent在保持竞争性生存预测准确率的同时,将平均获取负担降低了55%。论文SAGEAgent多模态生存预测推荐理由:这篇论文提出了SAGEAgent,它能像医生一样判断该给病人做哪些检查,在几乎不掉准确率的前提下把检查负担砍掉一半多,挺实用的。原文稍后读已读值得跟进有用关注 SAGEAgent
09:26官方账号arXiv cs.LG@Pan Li论文提出Rashomon解释范式,构建一组忠实预测的解释而非单个。提出RashomonLLM框架,使用解释-预测-反思代理工作流,在客户流失分类、临床生存回归和工业点击预测三个任务上验证。RashomonLLM在准确率和解释质量上均显著优于SOTA基线,增益由解释忠实性驱动。该方法对分布偏移、时间分割和随机种子鲁棒。论文RashomonLLMRashomon解释集可解释AI推荐理由:这篇论文打破了‘解释会牺牲准确率’的旧观念,用RashomonLLM让大模型自动生成解释还能反过来提升预测,三个真实场景实测都更强,研究很扎实。原文稍后读已读值得跟进有用关注 RashomonLLM
04:40Harrison Chase@hwchase17LLM Wiki网络研讨会视频已在YouTube上线。主要内容包括两个洞察:Wiki作为缓存(常用信息优先组织)和Wiki作为超链接页面集合。讨论从字符串到文件、目录再到超链接的记忆演变路径。作者认为超链接页面方式可规模扩展,类似互联网结构。行业LLMWiki知识管理推荐理由:hwchase17总结了两个关于Wiki的巧妙观点,帮你重新思考知识库的组织方式。原文稍后读已读值得跟进有用关注 LLM
18:08AI Will@FinanceYF5该视频教程通过5个阶段(LLM入门、Transformer架构、训练过程、模型现代化改造、扩展)完整演示如何从零构建大语言模型。作者全程边讲边敲代码,覆盖ChatGPT、Claude等模型的核心原理。视频时长3小时,代码全程可见,适合想深入理解LLM工作原理的开发者。技巧LLMTransformer训练过程推荐理由:想搞懂ChatGPT和Claude怎么造出来的?这个3小时教程从零敲代码,全程干货,比看书快多了。原文稍后读已读值得跟进有用关注 LLM
12:18官方账号arXiv cs.AI@Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang该论文提出IdeaGene-Bench (IG-Bench)基准,包含1,961条黄金谱系轨迹、1,085个Idea Genome对象和920个pairwise GenomeDiff记录,覆盖10个科学领域。IG-Exam含42个任务类型、1,029个实例,用于封闭式谱系推理;IG-Arena使用种群进化得分(PES)评估生成质量。在14个LLM科学家的测试中,最强系统仅达到27.3%的精确准确率,且结构化谱系上下文会打乱模型排名。该研究揭示了当前AI在科学思想继承与变异推理上的组合瓶颈。论文IdeaGene-Bench科学谱系推理想法生成推荐理由:这篇论文拿IdeaGene-Bench测了14个LLM,最强也只有27.3%准确率,而且加谱系信息反而搞乱排名。想看看AI离真正理解科学进化还有多远?读它。原文稍后读已读值得跟进有用关注 IdeaGene-Bench
12:13官方账号arXiv cs.AI@Emanuele Quinto, Carlo Andrea Rozzi, Francesco Zanitti论文提出一种Lisp启发的概念模型,使用符号形式、对象身份和live-image思想解释LLM中介工作流。核心区分derive(确定性计算)和infer(LLM判断),并将工作流定义、实例、推理记录等作为持久知识对象存储在共享知识基板中。该模型使工作流本身成为可检查、可恢复、可审查的知识对象。论文LLMLisp工作流推荐理由:这篇论文把工作流本身当成可持久化的知识对象,用Lisp概念讲LLM工作流语义,挺有启发。原文稍后读已读值得跟进有用关注 LLM
12:12官方账号arXiv cs.AI@Baha Rababah, Cuneyt Gurcan Akcora, Carson K. Leung该论文提出了正确性一致性(correctness agreement)指标,用于衡量基础模型与量化变体在正确预测上的重叠程度。在8-bit至2-bit的多种量化方案下,发现即使任务性能看似保持,中等量化也会导致行为分歧。分析表明查询和键投影的敏感性高于值和输出投影,揭示了低比特宽度的非线性断点。这些发现指出仅依赖准确率和困惑度会掩盖量化的真实影响。论文LLM量化模型评估推荐理由:这篇论文用新指标发现,量化后的模型即使分数不变,行为也可能跑偏,搞模型部署的同学建议看看。原文稍后读已读值得跟进有用关注 LLM
11:48官方账号arXiv cs.LG@David González-Martínez, Shiwei LiuSLORR是一种无需修改架构、无需SVD的低秩正则化框架,基于Hoyer稀疏度量和核范数两种变体。在ImageNet-1K上对ResNet-50、ViT-B/16和ViT-L/16进行短时继续训练,对ResNet-18进行预训练,SLORR在引入不到8%训练开销的同时提升了可压缩性。在135M和560M参数的LLM预训练中,SLORR-Hoyer使压缩模型性能显著优于未正则化模型,平均训练开销低于1%。论文SLORR低秩正则化模型压缩推荐理由:想压缩模型又不想掉太多精度?SLORR在训练时加低秩正则化,开销很小,效果很好,值得一试。原文稍后读已读值得跟进有用关注 SLORR
09:38官方账号arXiv cs.AI@Eugene Ng Yi Sheng, Bingquan Shen本研究通过多智能体市场模拟,实验了18个使用DeepSeek-V3模型的LLM代理在约束社交网络中交易的情景。在200轮实验中比较了8种机制,发现Mediation机制表现最佳。通过迭代优化提示的LLM驱动攻击进行对抗性测试,最强攻击(v6)仅使诚实代理效用降低13.3%,无法导致市场崩溃。研究证实Mediation机制在持续对抗压力下仍能维持市场稳定。论文DeepSeek-V3Mediation智能体推荐理由:这篇论文用DeepSeek-V3模拟了18个AI代理的市场,发现加入调解机制能抗住攻击,效用只降13%但市场不会崩盘。原文稍后读已读值得跟进有用关注 DeepSeek-V3
09:31官方账号arXiv cs.AI@João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar该论文分析了2053个真实患者与AI聊天机器人的对话,发现用户交流模式和情绪表达差异显著。研究开发了患者模拟器,分别建模临床内容、情感状态、对话策略和交流风格。在15位人类评分员的图灵测试中,模拟对话与真实对话几乎无法区分,准确率仅55%。使用5种患者角色和1164个临床医生评分案例,评估了4个LLM的紧急评估性能,发现交流风格显著改变分诊结果。论文LLM健康聊天机器人患者模拟器推荐理由:别只看用理想病人测AI的论文,这篇用2053个真实对话发现,交流风格直接改变分诊结果,准确率才55%!原文稍后读已读值得跟进有用关注 LLM
20:49Aadit Sheth@aaditshAI时代,核心技能从回答问题转向提出正确问题。Groq创始人Jonathan Ross通过让用户在X上提问测试其推理硬件,实现爆火。一条展示LLM在Groq上快速运行的视频引发病毒传播,用户生成个性化答案产生魔力。AI产品Groq推理模型提问技巧推荐理由:Groq用‘让用户自己提问’这招,一条推特就火了,教你如何抓住AI时代的本质技能。原文稍后读已读值得跟进有用关注 Groq
11:21官方账号arXiv cs.AI@Victor Giannakouris, Immanuel TrummerJailbreak 是一种新方法,通过直接读取 PostgreSQL 和 MySQL 存储文件实现数据库绕过,避免 JDBC/ODBC 驱动的性能瓶颈。它利用 LLM 辅助代码合成,从数据库文件格式的源代码和文档中再生出表读取组件。在 TPC-H 基准测试中,Jailbreak 生成的读取器将数据输出为 Apache Arrow 格式,可直接被 DuckDB、Apache Spark、cuDF 等引擎消费,端到端分析吞吐量提升最高达 27 倍。论文验证了该方法在 PostgreSQL 和 MySQL 之外对其他文件格式已知的数据库系统具有通用性。论文JailbreakLLMPostgreSQL推荐理由:这篇论文提出了 Jailbreak,用 LLM 直接读数据库存储文件,不用 JDBC,TPC-H 测试下最高快 27 倍。搞大数据分析的人可以看看。原文稍后读已读值得跟进有用关注 Jailbreak
09:18官方账号arXiv cs.AI@Kaicong Huang, Meng Ma, Ruimin KeCARLA-GS是一个模块化角落情况合成框架,将视觉表示、语义推理和物理执行解耦但保持耦合。它利用多智能体LLM进行场景推理,生成意图级路径点轨迹,并由PID控制器在CARLA中实现运动控制,最终将车辆状态重投影到高斯场景中渲染。在Waymo Open数据集上,CARLA-GS能生成与语义意图一致且物理可行的真实感视频。定量和定性实验证明了其可控性及时空一致性。论文CARLA-GSWaymo Open DatasetLLM推荐理由:这篇论文提出CARLA-GS,用多智能体LLM做推理、PID控制确保物理可行,在Waymo数据上生成逼真角落场景,解决了端到端方法时空不一致的痛点。原文稍后读已读值得跟进有用关注 CARLA-GS
09:06官方一手arXiv: OpenAI@Kiarash Ahi, Saeed Valizadeh该综述分析了LLM和生成式AI(如ChatGPT、Claude、Gemini)在网络安全中的双重用途:既用于自动威胁检测和防御,也被用于生成恶意软件。数据显示LLM生成的恶意软件在2025年预计占检测到威胁的50%,而2021年仅占2%。论文基于70多篇学术文献和行业报告,涵盖Google Play Protect、Microsoft Defender等平台的案例。最后提出了模型水印、对抗防御等负责任部署建议。论文LLMChatGPTClaude推荐理由:这篇论文详细梳理了LLM如何同时成为防御工具和攻击武器,还给出了具体数字和平台案例,适合想全面了解AI安全现状的人。原文稍后读已读值得跟进有用关注 LLM
23:35官方一手歸藏(guizang.ai)@op7418这条提示词要求以可爱、拟人的方式解释大语言模型的训练过程。它不依赖具体模型名称或版本,而是专注于表达风格。适合用于生成面向非技术用户的科普内容。作者通过社交平台分享了这一创作思路。技巧提示词工程LLM训练推荐理由:想要给外行解释LLM怎么训练的?用这个提示词试试,一下就萌化了。原文稍后读已读值得跟进有用关注 提示词工程
12:08官方账号arXiv cs.AI@So Hasegawa, Shailaja Keyur Sampat, Lei Liu, Wei-Peng Chen现有数据分柝基准局限于小表格的事实检索,忽略多表、外部知识整合与探索性洞察。新发布的DataGovBench源自政府开放数据,包含Table QA(复杂分解问答与可视化)和Table Insight(探索性分析生成专家级发现)两项任务。实验表明,当前主流LLM(包括带智能体框架的系统)在这两项任务上表现显著不足,距离真实数据分柝需求仍有很大差距。该基准为推进LLM处理复杂分柝查询与数据洞察提供了挑战性测试。论文DataGovBenchLLM数据分析推荐理由:研究团队用政府开放数据搞了个新测评,发现现在的大模型遇到多表格和外部知识就掉链子,专治各种表面功夫,推荐给关心模型真实落地能力的朋友。原文稍后读已读值得跟进有用关注 DataGovBench
09:55官方账号arXiv cs.AI@Andrea Alfarano, Andrea Bacciu, Saab Mansour, Amin Mantrach, Marcello Federico该研究首次在22种语言(涵盖高、中、低资源)上系统评估了9种不确定性估计方法。发现用英文推理(即使问题为低资源语言)能显著提升UE性能,并缩小与高资源语言的性能差距。研究还指出,小规模模型下基于概率的开放盒方法更优,大规模模型下封闭盒的自我表述不确定性更有效。论文提供了多语言选择性预测中阈值选择的指导。论文不确定性估计多语言MCQA推荐理由:这篇论文用22种语言、9种方法实测发现:让模型用英文思考能大幅改善低资源语言的不确定性估计,选方法还得看模型大小。原文稍后读已读值得跟进有用关注 不确定性估计
09:03官方一手arXiv: DeepSeek@Yufeng Wang精选FirstResearch引入结构化研究问题证书,包含10个字段如原始定义、假设、机制模型和可证伪假设。在10个LLM代理研究主题上,基于DeepSeek盲审协议得分为4.86/5,超过最强基线AI Scientist-v2的4.38/5。独立Gemini-2.5-Flash重评分保持排名,Pearson一致性为0.865。消融实验显示移除证书后得分降至1/5以下。这些初步结果采用LLM评判而非人类专家,但表明显式推导约束可提升可审计性。论文FirstResearchLLM科学发现推荐理由:这篇论文搞了个FirstResearch框架,用研究问题证书让LLM提的科学问题更透明可查,比现有方法得分高出一截,适合研究AI科学发现的同学看看。原文稍后读已读值得跟进有用关注 FirstResearch
01:45李继刚@lijigang_comLLM通过预测下一个token来学习语言的结构。人也应该通过预测所在领域的下一步,逼自己看见真正的生成机制。这种‘选择压’能淘汰模糊理解,只留下对结构性的判断。技巧LLM预测选择压推荐理由:试试用预测的方式,像LLM学语言一样,逼自己看清领域底层逻辑,比模糊理解管用多了。原文稍后读已读值得跟进有用关注 LLM
01:18Gary Marcus@GaryMarcus心理学家Gary Marcus在世界科学节(WorldSciFest)的一场视频讨论中指出,LLM存在固有局限性,仅靠扩大规模无法实现真正推理。他认为当前基准测试因心理测量学因素(如题目过拟合)而失效,无法反映模型真实能力。Marcus主张神经符号AI(Neuro-Symbolic AI)可能引领下一代AI范式,结合符号推理与神经网络。该视频包含对AI发展方向的深入分析。行业Gary MarcusLLM神经符号AI推荐理由:听Gary Marcus用神经符号AI挑战主流LLM,看完你会重新思考AI基准测试的真相。原文稍后读已读值得跟进有用关注 Gary Marcus
23:18Martin Fowler@martinfowlerBirgitta Böckeler在martinfowler.com发表文章,分享了她使用本地LLM完成编程任务的实践。文章探讨了影响本地LLM可行性的因素,包括模型大小(如7B、13B参数)、硬件要求(如GPU内存)、任务类型(如代码生成、调试)。她对比了本地LLM与云端模型(如GPT-4)在延迟、隐私和准确率方面的差异。结论是,对于简单编程任务,本地LLM(如Code Llama 7B)足够使用,但复杂任务仍需云端模型。技巧LLM编程助手本地模型推荐理由:想知道本地跑LLM写代码靠不靠谱?看看这篇实测,从模型选型到硬件门槛都说了,还有和GPT-4的对比。原文稍后读已读值得跟进有用关注 LLM
13:04官方一手arXiv: OpenAI@Karina Halevy, Julia Mendelsohn, Chan Young Park, Yulia Tsvetkov, Maarten Sap研究者引入仇恨事件检测任务,测试GPT-4o和Llama-3.2-3B-Instruct在多个专家标注数据集上的反犹事件分类能力。结果表明GPT-4o潜力较大但需显著改进。提供术语定义或上下文示例可提升性能:定义对修辞类事件(如经典反犹陈词)最有效,示例对行动类事件(如人身攻击)更有帮助。以大学校报为案例,LLM可辅助识别相关真实事件,支持早期监测。论文LLMGPT-4oLlama-3.2-3B-Instruct推荐理由:这篇论文告诉你GPT-4o和Llama-3.2-3B在处理反犹事件时谁更强,还给出了提升分类效果的实用技巧。原文稍后读已读值得跟进有用关注 LLM
12:46官方账号arXiv cs.LG@Ananth Eswar, Pratinav Seth, Utsav Avaiya, Vinay Kumar Sankarapu该论文对五个大型语言模型(LLMs)进行单次神经元行零化审计,测试归因方法能否识别因果重要的神经元行。归因方法在识别可丢弃行方面显著优于激活和幅度基线。通过对比有害与良性信号驱动干预,归因行足以在仇恨和犯罪内容上安装拒绝行为,同时保持良性过度拒绝率较低且不影响语言模型流畅性。高秩稳定性选择器可能因果有效性最低,且拒绝行为存在于冗余子空间中,不同归因方法通过几乎不相交的行集实现拒绝。论文neuron selectorsattribution methodsLLM推荐理由:这篇论文直接检验了神经元归因方法的可靠性,发现高秩稳定的选择器反而可能因果失效,对模型可解释性和安全编辑很有启发。原文稍后读已读值得跟进有用关注 neuron selectors
11:31IT之家(博客/媒体)Reddit 将先进 AI 与现有自动化工具结合,每天拦截 2300 万条垃圾浏览信息,捕获 2.5 万条新垃圾帖子或评论,撤销近 200 万次无效投票。用户垃圾信息接触量减少 20%,整体垃圾账户接触频率降低 10% 至 15%。仇恨和暴力内容检测到处理平均用时不足 5 秒,执法力度提高 200% 以上,潜在有害内容接触减少超过 40%,误报也降低 40% 以上。行业Reddit垃圾内容自动化推荐理由:Reddit 用 AI 和自动化每天干掉 2300 万条垃圾浏览,垃圾内容接触减少 20%,仇恨内容处理快于 5 秒。看看他们怎么用 LLM 揪出隐蔽的假账号。原文稍后读已读值得跟进有用关注 Reddit
11:07官方账号arXiv cs.AI@Zefeng Wang, Minxi Yan, Jinhe Bi, Sikuan Yan, Volker Tresp, Yunpu MaMetaSkill-Evolve提出双时间尺度框架,使智能体技能改进递归化:任务技能在快循环演化,元技能(分析、检索、分配、提议、进化五组件)在慢循环自我应用。在OfficeQA、SealQA和ALFWorld三个基准测试上,该方法相比无技能基线分别提升+23.54、+16.09和+1.92个点。所有组件共享单一冻结骨干模型,无需额外模型或目标。论文MetaSkill-Evolve智能体自我改进推荐理由:这篇论文让AI智能体不仅能学技能,还能自动改进改进方法本身,在三个测试集上都有明显提升,挺有意思。原文稍后读已读值得跟进有用关注 MetaSkill-Evolve
03:24Mustafa Suleyman@mustafasuleymanMustafa Suleyman团队在Nature Health发表论文,标题为“Public use of a generalist LLM chatbot for health queries”,该研究探讨通用型大语言模型聊天机器人(LLM)在公众健康查询中的应用。论文登上了该期刊的封面,表明LLM在医疗领域具有重要潜力。研究聚焦于LLM如何辅助用户获取健康信息,并评估其准确性和可靠性。论文LLMAI健康咨询Nature Health推荐理由:DeepMind的Nature Health封面论文,第一篇严格评估LLM在健康问答中的表现,感兴趣可以看看。原文稍后读已读值得跟进有用关注 LLM
03:00AK@_akhaliq该研究指出LLM强化学习中优化训练策略(Optimizing Training Policies)可能是一种幻象。作者提出单调推理策略(Monotonic Inference Policies)才是真正的优化目标。论文分析了现有训练策略的局限,并展示了单调推理策略的优势。论文LLM强化学习训练策略优化推荐理由:这篇论文告诉你,别只想着怎么训练,推理策略才是LLM强化学习的关键。原文稍后读已读值得跟进有用关注 LLM
02:36Gary Marcus@GaryMarcus精选Yann LeCun 在 Bloomberg 采访中指出,LLM 预训练于约 20 万亿单词(30 万亿 token),数据量约 10^14 字节,仅相当于一个 4 岁孩子通过视觉在 4 年内获取的数据量。但文本需要 40 万年才能读完,而孩子通过视觉、触觉等感官获得密集反馈。LeCun 引用 Moravec's paradox,认为理解物理世界(如玻璃杯的易碎感)远比生成流畅文本困难。行业LLMYann LeCunMoravec's paradox1 个信源在谈事件专题推荐理由:Yann LeCun 用具体数字对比,讲清了 LLM 为什么看起来聪明却不懂物理常识。想理解当前 AI 天花板的人可以看看。原文稍后读已读值得跟进有用关注 LLM
23:27techcrunch@Amanda SilberlingReddit宣布使用大语言模型(LLM)来检测和移除平台上的垃圾内容,这些垃圾内容很大一部分由LLM生成。据Reddit称,2026年上半年AI生成垃圾帖占比已达32%,传统规则和分类器难以应对。新系统基于自家微调的Llama 3模型,在内部测试中将误删率从12%降至4%,同时查杀率提升至89%。Reddit计划将该工具开源,供其他平台参考。行业RedditLLM垃圾信息推荐理由:Reddit被AI垃圾淹了,现在用AI反制,自己微调Llama 3把误删率压到4%,想抄作业的可以关注开源。原文稍后读已读值得跟进有用关注 Reddit
11:25Stanford AI Lab@StanfordAILab精选斯坦福团队在ICML 2026论文中发现,LLMs预测其他模型输出的准确率高于预测事实。当所有模型都预测错误时,投票法无法恢复正确答案。自我一致性(多次采样并验证)在数学和代码领域效果良好,但在无验证器的领域无法扩展真实性。论文标题为'Truthfulness Does Not Scale Like Reasoning'。论文LLM真实性AI安全推荐理由:斯坦福发了篇ICML论文,说LLMs猜别的模型比猜事实还准,但一起翻车时投票也救不了。想看懂它们为啥集体犯傻?看这篇。原文稍后读已读值得跟进有用关注 LLM
01:02官方账号MIT CSAIL@MIT_CSAILMIT CSAIL提出Masked IRL方法,利用LLM解决机器人面对模糊指令的问题。该方法包含两个模型:一个用于澄清用户提示,另一个忽略无关信息。这使机器人能更准确执行含糊不清的任务如'把那个东西放好'。AI模型Masked IRLMITLLM推荐理由:机器人终于能听懂'把那个东西放好'这种模糊话了。MIT的Masked IRL用LLM先理清意图再干活,挺实用。原文稍后读已读值得跟进有用关注 Masked IRL