10:13宝玉@dotey这条推文回应了把 GitHub access token 永久写进所有 harness 的 AGENTS.md 的做法,作者明确说自己用的是 ChatGPT 网页版而不是 Codex。他更推荐用 GitHub CLI 管理凭证,认为这比 access token 更安全。他还提到不需要插件,直接用 GitHub CLI 就能完成配置。技巧ChatGPTCodexGitHub CLI推荐理由:别急着把 token 写进 AGENTS.md,用 GitHub CLI 更安全,作者说网页版 ChatGPT 也能这么配。原文稍后读已读值得跟进有用关注 ChatGPT
02:51elvis@omarsar0精选Harness-IF提出一种规则评估方法,通过从执行证据中逐条打分256条规则,并在九个探针构建中撤回每条规则后重跑任务,来区分规则是否真正改变了模型行为。在12个前沿模型上,原始准确率为72.1%到85.9%,剔除巧合后的Against-Prior准确率降至66.1%到78.6%,每个模型下降3.6到7.4个点。研究发现优先级不随提示词深度变化,系统提示、项目文件和用户指令的优先级都高于工具和技能描述。论文见arxiv.org/abs/2608.11727。论文AGENTS.mdHarness-IF智能体推荐理由:如果你在给编码智能体写AGENTS.md,这篇论文用256条规则和12个模型实测告诉你哪些规则真有用,别凭感觉写了。原文稍后读已读值得跟进有用关注 AGENTS.md
17:41elvis@omarsar0精选一项研究追踪了1,867个仓库中247,694条指令的生命周期,发现CLAUDE.md等指令文件会无限增长。追加一条指令无需成本,而删除一条需付出指数级验证成本,因此无人删除。文件中的提示词在生命周期内增长超过三倍,每次提交净增4.9条指令。研究者提出用注释记录指令理由,在可验证环境中消除了99.3%的多余指令,并将真实智能体指令遵循度提升至多23.1%。论文CLAUDE.mdAGENTS.md提示词工程推荐理由:这条论文用24万条指令数据告诉你CLAUDE.md为什么越写越长,还给了注释法这个解法,提升多到23%。原文稍后读已读值得跟进有用关注 CLAUDE.md
11:59shao__meng@shao__meng精选OpenAI、AWS、Cursor、GitHub、VS Code和Vercel联合推出Agent Plugins开放标准,将Agent Skills和MCP服务器配置打包为跨客户端可移植插件。Anthropic未参与该标准,AGENTS.md标准同样未被其采纳,Claude Code至今仍使用CLAUDE.md。相比之下,Anthropic自己发起的MCP和Agent Skills已成为各Agent客户端通用标准。目前Agent Plugins和AGENTS.md的通用范围仍排除了Claude Code,跨Agent通用尚未实现。行业AnthropicClaude CodeMCP10 个信源在谈事件专题推荐理由:Anthropic没参加Agent Plugins标准,Claude Code也不用AGENTS.md,但自家MCP却成了通用标准。生态割裂得很真实。原文稍后读已读值得跟进有用关注 Anthropic
05:46官方一手@OpenAIDevs@OpenAIDevs精选该 primary folder 可处理 Git 操作、代码审查和拉取请求。它还包含 AGENTS.md 配置文件,用于定义 Agent 行为。并集成了技能发现功能,让 Agent 自动获取能力。AI产品OpenAI智能体Git10 个信源在谈事件专题推荐理由:OpenAI 搞了个专用文件夹,一次搞定 Git 操作、代码 Review 和技能发现,Agent 开发省事多了。原文稍后读已读值得跟进有用关注 OpenAI
11:16shao__meng@shao__meng81°OpenAI 为 Codex Code Review 推出 AGENTS.md 规则文件,允许团队将隐性审查知识写入仓库。在测试集上,带规则的审查找到了 98% 的目标问题,远超无规则时的 58.3%,提升来自为模型补上“该看什么”的上下文。规则需聚焦于如兼容性、数据边界等难以用 linter 捕捉的判断类问题,并给出安全替代方案。OpenAI 建议用三元测试(一个应触发规则、一个安全反例、一个无关改动)来快速验证规则质量。技巧OpenAICodex Code ReviewAGENTS.md10 个信源在谈事件专题推荐理由:OpenAI 给 Codex Code Review 加了 AGENTS.md 规则,能抓住 diff 看不出的破坏性改动,评测召回率从 58% 提到 98%原文稍后读已读值得跟进有用关注 OpenAI
03:29官方一手@OpenAIDevs@OpenAIDevs74°OpenAI 推出新功能,Codex Code Review 现在支持在 AGENTS.md 文件中定义自定义仓库规则。用户可以将审查者反复提到的常见问题写为简洁规则,让 Codex 捕获仓库特定问题,即使相关上下文被隔离。该功能提升了代码审查的准确性和针对性。AI产品CodexOpenAI代码审查10 个信源在谈事件专题推荐理由:Codex 代码审查现在能用 AGENTS.md 配置你的仓库专属规则了。把团队常见的检查点写进去,Codex 就能帮你自动抓私有仓库的特有问题。原文稍后读已读值得跟进有用关注 Codex
07:04GitHub@githubGitHub宣布Copilot代码审查功能现已支持AGENTS.md文件。开发者可在仓库根目录放置AGENTS.md,写入命名约定、安全规则等自定义指令。Copilot会读取该文件,使审查反馈更符合项目规范。这项改进让审查结果更具上下文感知能力,无需手动另设规则。AI产品CopilotGitHubAGENTS.md推荐理由:GitHub Copilot现在能读你项目里的AGENTS.md文件,代码审查会更懂你的命名习惯和安全规则,不用再手动调规则了。原文稍后读已读值得跟进有用关注 Copilot
15:24宝玉@dotey处理AI编程助手(如Codex)产生的代码错误时,应优先恢复生产(回滚或打补丁),再找根因(逻辑错误、边界条件、需求偏差)。根据根因决定解决方案,边界问题加测试用例,架构缺陷重构,代码审查漏洞改进流程。仅当错误根因是AI缺乏项目特有约定(如命名规范、API隐含限制)时才更新AGENTS.md。否则会导致AGENTS.md臃肿、规则失效,AI反而忽略重要规则。技巧CodexAGENTS.md编程助手推荐理由:别一出bug就怪AI,也别什么都写进AGENTS.md。这篇讲了如何按软件工程流程正确应对,很实在。原文稍后读已读值得跟进有用关注 Codex
01:55宝玉@dotey精选Mitchell Hashimoto 在 AGENTS.md 文件和代码注释中嵌入 prompt injection。这些注入用于检测未审查代码就直接提交至另一位人类维护者的贡献者。一旦检测到,他会立即封禁该贡献者。他认为在开源项目中,跨越人类边界前进行人工审查是基本礼貌。行业prompt injectionAGENTS.mdMitchell Hashimoto推荐理由:Mitchell 这招挺狠,在项目文件里埋 prompt injection,谁不审代码直接提交就封号。搞开源维护的可以学学这招防饭圈。原文稍后读已读值得跟进有用关注 prompt injection
09:31shao__meng@shao__meng精选76°一篇大规模实证研究评估了仓库级上下文文件(如 AGENTS.md、CLAUDE.md)对编码 Agent 任务完成率的影响。实验覆盖 SWE-bench Lite 和新建 AGENTBENCH 两个基准,测试了 Claude Code、Codex、Qwen Code 等四种 Agent。结果显示,LLM 自动生成的 context file 在多数设置下导致成功率下降(平均 -0.5% 至 -2%),开发者手写的仅提升 +4%,但步数和成本增加 20% 以上。轨迹分析表明 Agent 会过度执行 context file 中的建议性流程,增加复杂度却未提升成功率。当仓库文档齐全时,context file 与现有文档高度冗余,反而可能有害。技巧Coding AgentAGENTS.md上下文文件推荐理由:这篇论文戳破了 AGENTS.md 的神话——自动生成不仅没用还更贵,手写提升也有限。做 Coding Agent 工具或维护大型仓库的团队,看完会重新评估是否值得投入 context file。原文稍后读已读值得跟进有用关注 Coding Agent