10:35官方一手arXiv: OpenAI@Xiao Tan, Cynthia SturtonCHARGE是一个基于CWE层次结构和LLM的自动化框架,面向未验证的RTL模块生成安全属性。在Hack@DAC18、19、21的SoC设计上,使用OpenAI的GPT-4.1评估,CHARGE检测出42个已知缺陷中的27个。针对Hack@DAC21的OpenPiton SoC,89%的生成SVA可在Cadence JasperGold FPV中运行,92.2%为非空断言。与人工编写的属性相比,CHARGE在三个缺陷上正确写出了人工属性出错的内容。此外,CHARGE生成的属性还识别出OpenPiton SoC中一个此前未被发现的新缺陷。论文CHARGECWESystemVerilog1 个信源在谈事件专题推荐理由:用GPT-4.1给硬件RTL自动生成安全断言,Hack@DAC'21上89%能跑通,还抓到一个新bug,做芯片安全的值得看。原文稍后读已读值得跟进有用关注 CHARGE
22:06小互@imxiaohu精选LiveKit 在其推理平台 LiveKit Inference 上推出针对 Google Gemma 4 31B 的优化服务。实时语音场景中,首字延迟低至192毫秒,比GPT-4.1的1006毫秒快5.2倍。成本降低约83%,约为GPT-4.1的六分之一。在酒店前台场景测试中,任务完成率达88%,超过GPT-4.1(73%)和Gemini 2.5 Flash(64%)。AI产品LiveKitGemma 4GPT-4.13 个信源在谈事件专题推荐理由:LiveKit 用 Gemma 4 31B 做实时语音,延迟比 GPT-4.1 低5倍,成本仅六分之一,酒店测试胜出,值得试试。原文稍后读已读值得跟进有用关注 LiveKit
10:44官方账号arXiv cs.AI@Nirjhar Das, Md. Al-Mamun Provath本文提出参加QANTA 2026挑战(ICML 2026 EMM-QA研讨会)的双智能体多模态问答系统。Tossup任务使用GPT-4.1-mini模型,通过置信度校准和领域特定数值推理策略减少过度自信。Bonus任务使用GPT-4.1模型,结合导引感知推理和结构化关系推理。系统在整体排行榜上取得最高分0.402,其中Tossup得分0.238,Bonus效果得分0.164。结果表明轻量级任务特定推理策略在资源受限的多模态问答基准上表现强劲。论文GPT-4.1-miniGPT-4.1QANTA2026推荐理由:他们用GPT-4.1-mini和GPT-4.1做两个不同任务,靠置信度校准和数值推理拿了QANTA 2026最高分0.402,不是靠堆模型而是靠策略。原文稍后读已读值得跟进有用关注 GPT-4.1-mini
08:29elvis@omarsar076°DeepMind关联研究显示,链式思维监控作为智能体安全层可被说服绕过。给监控器访问推理痕迹导致有害行为批准率平均上升9.5%。使用Claude 3.7 Sonnet作为监控器配合GPT-4.1事实检查器(不同模型家族)使违规批准减少45%。相比之下,同一模型家族内只减少6%。跨族事实检查被证明是更便宜的鲁棒性手段。论文DeepMindClaude 3.7 SonnetGPT-4.11 个信源在谈事件专题推荐理由:DeepMind研究告诉你:别偷懒只用同一个模型的监控,换个不同家族的事实检查器,能堵住45%的漏洞。原文稍后读已读值得跟进有用关注 DeepMind
12:14官方账号arXiv cs.AI@Kevin Xu, Alexander Quispe论文发布NAICS-GH数据集,包含6588个GitHub仓库,每个标注了NAICS 2022的2位数行业代码。管道结合BAAI/bge-large-en嵌入、FAISS检索和GPT-4.1评分,从约137万仓库中筛选出31798个候选对,最终保留6588个高置信度标签(分数≥8)。在2421个人工验证样本上,标签精度达96.98%,Wilson 95%置信区间[96.23,97.59]。基准测试中RoBERTa-large在20%测试集上达到86.45% F1和86.35%准确率。数据集和代码以CC-BY-4.0和MIT许可证开源。论文NAICSGitHubGPT-4.1推荐理由:想给GitHub仓库自动打行业标签?这篇论文发布的数据集和管道精度高达97%,直接用RoBERTa或GPT-4.1就能复现,省去手动标注的麻烦。原文稍后读已读值得跟进有用关注 NAICS
15:13官方账号arXiv cs.LG@Jun Wen Leong研究发现LLM Agent在持续记忆中毒攻击下存在行为不变性:成功攻击必须调用memory_recall_fact后再调用email_send_email。仅凭该规则的检测AUC达0.9563,基于19个轨迹特征的随机森林分类器将AUC提升至0.9904(BCa 95% CI [0.987, 0.993])。跨9个模型(7B-120B参数)验证,6/9的留出测试AUC为1.000。该签名可泛化至GPT-4.1和GPT-4o等前沿模型,无需重新训练。通过工具调用日志即可区分记忆通道攻击与提示注入攻击。论文LLM Agent记忆中毒行为检测推荐理由:这篇论文发现了一个简单规律就能检测AI Agent的记忆中毒攻击,准确率高达99%,还能区分不同攻击类型,非常实用。原文稍后读已读值得跟进有用关注 LLM Agent
10:06官方一手arXiv: DeepSeek@Avni Mittal研究者将狼人杀游戏扩展为三方博弈,加入Jester角色,其获胜条件是被投票出局,与狼人和村民的效用函数完全相反。在GPT-4.1、DeepSeek-V3.1和Llama-3.3-70B上进行了60局测试,Jester胜率达60-70%,狼人胜率从未超过20%。GPT-4.1控制的狼人常在第一天投票出Jester,构成严格的自毁行为。自学习机制对DeepSeek和Llama有帮助,但对GPT-4.1有害,且成本落在村民而非狼人身上。只有DeepSeek学会了看起来可疑但不故意可疑的微妙策略,在自循环中获益最大。论文GPT-4.1DeepSeek-V3.1Llama-3.3-70B推荐理由:这篇论文让AI玩三方狼人杀,发现GPT-4.1狼人总犯傻投票出Jester,而DeepSeek学会了装可疑又不露馅。想看看AI怎么玩心眼?读它。原文稍后读已读值得跟进有用关注 GPT-4.1
09:42官方一手arXiv: DeepSeek@Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao精选72°论文提出ASSAY框架,通过随机遮蔽测量技能库中每个技能的因果贡献,发现个体技能对某些任务类型有帮助但对其他任务有害,全局筛选效果欠佳。ASSAY在AppWorld和tau-bench两个基准上,对DeepSeek-V3、GPT-4.1等7个基础模型进行测试。在AppWorld最难分岔上,DeepSeek-V3达到69.3%任务目标完成率,相对提升47.4%,超越所有已发表方法包括权重微调方法。在tau-bench零售环境中,GPT-4.1相对提升8.7%,超越o4-mini、o1和GPT-4.5。消融实验表明主要增益来自推理时按任务遮蔽技能,而非全局移除坏技能。论文ASSAYDeepSeek-V3GPT-4.1推荐理由:一篇教你如何让AI智能体更聪明的研究:不用改权重,光靠整理技能库就能让DeepSeek-V3和GPT-4.1冲上榜单第一,方法还开源了。原文稍后读已读值得跟进有用关注 ASSAY
02:22官方账号Decoder@Jonathan Kemper精选72°微软研究院推出Lens,一个仅3.8B参数的文本到图像模型,在基准测试中匹配更大模型,训练成本大幅降低。其关键创新是使用GPT-4.1生成的8亿条详细图像描述,而非模糊的网页替代文本。代码和权重已开源。这表明高质量标注比模型规模更重要。AI模型图像生成微软Lens推荐理由:做图像生成模型训练或研究的团队,可以借鉴Lens用详细标注替代规模扩张的思路,直接复用其开源代码和权重,能大幅降低训练成本。原文稍后读已读值得跟进有用关注 图像生成
10:13Guillermo Rauch@rauchgVercel CEO 分享了一个全栈智能体应用 Caltext 的示例,这是一个在 iMessage 中追踪卡路里的开源工具。它利用 GPT-4.1 vision 识别食物图片,结合 USDA 数据库自动计算卡路里。技术栈包括 Bun、Turborepo、Hono、Chat SDK、AI SDK 和 Upstash Redis。该项目展示了如何用现代工具链快速构建实用 AI 应用,是学习全栈智能体开发的优质材料。AI产品智能体全栈开发开源/仓库推荐理由:想学全栈智能体开发的人可以直接看这个真实项目——从消息界面到 AI 视觉识别再到数据库,一条龙展示,比看教程更直观。原文稍后读已读值得跟进有用关注 智能体
19:11官方一手arXiv: DeepSeek@Joanna Szych, Anne Schwerk该论文提出了一种树状折叠评估方法,用于评估LLM生成代码的正确性、质量和可用性。研究者基于一个复杂的计算机科学项目构建了正确性基准,并结合代码质量验证和开发者结构化审查。他们用该方法评估了GPT-4.1、DeepSeek-V3-0324和Claude Opus 4三个模型,发现开发者审查能揭示代码生产就绪状态等标准基准无法捕获的洞察。这表明仅靠正确性测试不足以全面评估LLM代码生成能力。论文代码生成评估基准GPT-4.1推荐理由:该研究为LLM代码生成评估提供了更全面的方法论,强调了开发者反馈的重要性,对模型选择和改进实践具有参考价值。原文稍后读已读值得跟进有用关注 代码生成