技巧多源确认精选78°

为 GPT-6 Astra 重新设计 Skills 和提示词

别再“硬教”模型做事:为 GPT-6 Astra 重新设计你的 Skills 和提示词 为旧模型辛辛苦苦、修修补补积累的指令,正在成为新模型的负担。 GPT-6 Astra 模型能力提升后,过去用来...

精选理由

OpenAI 建议开发者为 GPT-6 Astra 重新设计 Skills 和提示词,别再“硬教”模型做事,要告诉它边界和完成标准。

旧模型辛辛苦苦积累的指令,正在成为新模型的负担。GPT-6 Astra 能力提升后,过去用来“补偿模型弱点”的提示词约束过度约束了它;从“教它怎么做”转向“告诉它边界在哪、完成标准是什么”,把方法论的自主权还给模型。

原文 · shao__meng

别再“硬教”模型做事:为 GPT-6 Astra 重新设计你的 Skills 和提示词 为旧模型辛辛苦苦、修修补补积累的指令,正在成为新模型的负担。 GPT-6 Astra 模型能力提升后,过去用来...

别再“硬教”模型做事:为 GPT-6 Astra 重新设计你的 Skills 和提示词 为旧模型辛辛苦苦、修修补补积累的指令,正在成为新模型的负担。 GPT-6 Astra 模型能力提升后,过去用来“补偿模型弱点”的提示词约束(skills、AGENTS.md、任务提示)如今过度约束了 GPT-6 Astra;它本来能做得更好,却被过时的指令拉低了表现。因此,新模型发布不应只是“换个模型名”,应是一次清理提示词债务的机会。 OpenAI Developer 官方博客: 从“教它怎么做”转向“告诉它边界在哪、完成标准是什么”。把方法论的自主权还给模型,自己只保留意图和约束的定义权。 developers.openai.com/blog/rethinkin… 1. Skills:从“能用”到“精准触发” Skills 本质是 Markdown 存储的提示词(可附带资源与脚本),适合封装特定工作流。常见问题有两个: · 描述太宽泛,导致错误触发。坏示例:"Use when working with databases, queries, models, or persistence",凡是沾数据库边的任务都会加载它。好示例:"Use when adding or changing a migration, or reviewing its rollout",只在真正相关时触发。 · 装太多 skills,描述列表过长会被截断,且不同 skill 的描述可能互相矛盾。描述应在“足够简短”和“能准确信号何时使用”之间取平衡。 两条结构性原则: · 渐进式披露:读取 skill 会消耗上下文、加速触发上下文压缩。多工作流的 skill,根文档应该是一个最小化的路由器,只告诉模型“去哪找”,不强迫它读完全部内容。 · 不要写详尽的“操作手册”:现代模型处理细微差别的能力已经很强,过去那种手把手的步骤指导现在反而有害。 · 值得注意的细节:仓库里的 skills 也会引导其他贡献者的 agent(可能运行在 Sol、Luna 等不同模型上)。为弱模型优化的指令,会过度约束 GPT-6 Astra。这是一个跨模型协作的权衡问题。 2. AGENTS.md:从“强制流程”到“按需导航” AGENTS.md 始终生效,所以每条指令都值得定期复审。 · 不要强制全量阅读。坏示例:"Before every edit, read architecture.md, database.md, and deployment.md",小改动也要读三份文档,过度。好示例:"Use architecture.md for service boundaries, database.md for schema changes",把每份文档映射到场景,模型自己判断何时需要。GPT-6 Astra 能自主决定读什么。 · 测试指令:旧模型需要被提醒“去跑测试”;Astra 会自己做,这类指令反而可能导致不必要的重复测试。 · 权限预授权:用 AGENTS.md 为安全的工作流提前放行。原文示例:"The local tests use disposable fixtures and have no production access. Run them, fix failures caused by the requested change",即本地测试用一次性 fixture、不碰生产环境,直接跑、直接修,不必逐步请示。 3. 决策边界:旧防线可能变成新枷锁 为旧模型添加的强“先询问”措辞需要重新审视。GPT-6 Astra 被描述为对齐程度最高的模型,判断力更好,在不确定安全时它本来就不会行动。保留过时的边界语言,会让它在你其实希望它继续的地方过早停工。换句话说:谨慎措辞的收益随模型对齐程度提升而递减,成本却在上升。 4. 持久性:最关键的行为差异 最具实操价值的部分,因为它揭示的是模型间的个性差异,超出了单纯的能力范畴: · GPT-5.6 Sol 拿到请求后会长时间持续工作。 · GPT-6 Astra 对“何时该停”更谨慎,倾向于在第一版实现完成后就返回,即使活还没干完。 应对方法: · 在请求中预先定义“完成”。如果你的“完成”意味着实现、检查、修复失败,就在任务描述里说清楚。 · 慎用“实现后停下等审查”这类指令。它会强化模型的早停倾向,只在真正需要这个检查点时才写。 · 想要更深入的探索,就明确指定探索什么、在哪停下。 OpenAI Developers @OpenAIDevs Get more out of GPT-6 Astra by revisiting your skills, AGENTS.md, and task prompts. Make skill triggers specific, load guidance when it's relevant, and define what done looks like. developers.openai.com/blog/rethinkin… 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 1 👀 681 📊 1 ⚡