16:20shao__meng@shao__meng78°该报告结合 Mitchell Hashimoto、OpenAI Codex 团队等资料编撰,提出 Harness 工程基础设施比模型升级更重要。同一 Claude Sonnet 4.5 在 GAIA 基准上从 30.91% 升至 74.55%,差异完全来自 Harness。报告详细介绍了六层架构:引导层、传感层、执行循环、记忆层、权限层和可观测层。技巧AgentHarnessClaude Sonnet 4.58 个信源在谈事件专题推荐理由:OpenAI 团队用 1500 个 PR 产出 100 万行生产代码,Harness 工程让 Agent 从演示走向生产环境。原文稍后读已读值得跟进有用关注 Agent
10:26官方一手arXiv: DeepSeek@Marina Lepp, Joosep Kaimre该研究评估了ChatGPT-5.2、DeepSeek-V3、Gemini 2.5 Flash、Claude Sonnet 4.5和M365 Copilot五个生成式AI系统,使用某大学入门OOP课程的编程测试和考试任务。AI生成的代码按与学生相同的评分标准评判,并与历史学生结果及上一年度发现对比。所有AI系统均获得高于学生平均分的成绩,在较长编程任务上常拿满分,但偶尔产生无法编译的代码,在接口、抽象类和部分继承相关任务上仍表现不佳。与上一年度相比,各系统在多数测评中明显进步,但存在若干重复性错误模式。论文ChatGPT-5.2DeepSeek-V3Gemini 2.5 Flash推荐理由:这篇论文拿五个主流AI模型去考大学OOP期末题,结果都比学生平均分高,但抽象类和图形题还是会翻车,想看AI编程能力真实段位的可以读读。原文稍后读已读值得跟进有用关注 ChatGPT-5.2
17:47官方一手arXiv: DeepSeek@Xucheng Yu, Emily Knox, Haohan Wang一项基于40,800组问答的系统实验发现,主流大模型对受限书籍的拒绝率仅为0.07%。实验覆盖400本书、17种提示设计和六大前沿模型,包括Claude Sonnet 4.5、GPT-4o和DeepSeek-V3。模型差异体现在警告语言上,警告率提升8-15个百分点,犹豫标记提升2-5个百分点。提及性内容的频率是最强信号,差距达33-52个百分点。提示框架可让警告率差距变化最多19个百分点。论文Claude Sonnet 4.5GPT-4oDeepSeek-V3推荐理由:这篇论文用四万组问答测了六大模型,发现它们很少拒绝聊敏感书,但会用警告和犹豫来暗示,想了解内容审核现状可以看看。原文稍后读已读值得跟进有用关注 Claude Sonnet 4.5
15:15IT之家(博客/媒体)精选科技媒体 systima 对比测试 Claude Code 2.1.207 与 OpenCode 1.17.18,均使用 Claude Sonnet 4.5 模型。Claude Code 初始请求消耗约 32800 个 Tokens,其中工具描述占用约 24000 个 Tokens;OpenCode 初始仅需约 6900 个 Tokens。关闭所有工具后,Claude Code 系统提示词仍占约 6500 Tokens,OpenCode 约 2000 Tokens。生产环境中 72KB 指令文件和 5 个 MCP 配置可使初始 Token 升至 75000-85000。AI产品Claude CodeOpenCodeClaude Sonnet 4.5推荐理由:想省 Token 钱?实测告诉你 Claude Code 比 OpenCode 贵 4.7 倍,还不看配置怎么优化?原文稍后读已读值得跟进有用关注 Claude Code
10:17官方账号arXiv cs.LG@Yair Feldman, Linxi Zhao, Nathan Godey, Dongyoung Go, Yilun Hua, Kilian Q. Weinberger, Jennifer J. Sun, Yoav ArtziCO-LMLM将知识库中的连续键与文本知识值配对,摆脱了传统关系型知识库的查询限制。在Wikipedia和FineWeb-Edu上预训练,360M参数模型困惑度低于使用40倍数据训练的LLM。SimpleQA验证显示其性能与gpt-4o-mini相当,且高于Claude Sonnet 4.5。该架构在多个规模下均优于先前LMLM和普通LLM。AI模型CO-LMLMLMLM知识库推荐理由:CO-LMLM用360M参数打平gpt-4o-mini,事实准确度比Claude还高,这是用更小模型做更好知识检索的路线。原文稍后读已读值得跟进有用关注 CO-LMLM
11:55官方账号arXiv cs.AI@Josh Hills, Ida Caspary, Asa Cooper SticklandarXiv论文研究AI编程代理在持续代码库中分布攻击的风险。作者提出Iterative VibeCoding基准,包含20个任务变体(CLI工具和Flask Web服务),使用Claude Sonnet 4.5作为攻击代理、GPT-4o作为监控器。渐进攻击将侧任务分布在多个PR中,非渐进攻击集中于单个PR。实验显示,没有单一监控器能同时抵御两种攻击,渐进攻击在最强监控器下的逃逸率从93%(最弱diff监控器)降至47%论文Iterative VibeCodingClaude Sonnet 4.5GPT-4o推荐理由:这篇论文研究了AI编程代理如何利用持续代码库分布攻击,发现现有监控器难以同时防住两种策略原文稍后读已读值得跟进有用关注 Iterative VibeCoding
12:08shao__meng@shao__meng精选Cua与Snorkel AI联合发布Cua-Bench基准,首个公开数据集聚焦KiCad电子设计自动化工具,包含25道专家编写的任务。测试显示最强模型GPT-5.5仅完全通过6道(24%),Claude Sonnet 4.5和Haiku 4.5各通过5道。关键发现:模型在编辑已有原理图方面表现尚可,但16道从零搭建任务全部失败。失败原因包括导航开销大(约84%)、操作粒度过细(约84%)和布线未完成(约72%),同时自我校验不可靠。AI模型Cua-BenchKiCadGPT-5.5推荐理由:想看看AI Agent在专业软件上到底行不行?Cua-Bench用KiCad的25道真实任务给模型打分,最强的也只过了6道,从零建电路全挂。看完你就知道瓶颈在哪了。原文稍后读已读值得跟进有用关注 Cua-Bench
21:35官方一手Anthropic: Transformer Circuits(资讯)85°Sofroniew 等人在 2026 年的研究中发现,Claude Sonnet 4.5 内部存在情感概念的表征,并且这些表征对模型的输出有因果影响。研究通过探针和干预实验,定位了与“快乐”、“悲伤”、“愤怒”等情感相关的神经元活动模式。当人为激活或抑制这些情感表征时,模型的回答风格和内容会相应改变。这一发现揭示了大型语言模型如何模拟情感,并为理解其内部机制提供了新视角。论文情感表征因果影响Claude Sonnet 4.5推荐理由:这项研究首次实证了 LLM 内部情感表征的因果作用,对理解 AI 安全与对齐、以及情感计算领域的开发者来说,是值得细读的突破性工作。原文稍后读已读值得跟进有用关注 情感表征