菜单
积墨AI

积墨AI

大模型能力跃升:重新审视Coding Agent的提示词与技能设计

过去一年,使用 Coding Agent 的开发者几乎都有一个共同感受:项目里的说明文件越来越厚,Prompt 越来越长,Skill 也越装越多。模型哪里表现不好,就补一条规则;怕它漏掉测试,就写上「修改完成后必须运行测试」;担心它做过头,再补一条「执行下一步之前先询问用户」。时间一久,一套给 Agent 使用的说明文件,慢慢累积成几十甚至上百条规则。但近几个月,OpenAI、Anthropic 等模型厂商陆续发布新的设计指南,核心建议出奇一致:当模型能力已经大幅提升之后,那些为早期模型「打补丁」攒下来的规则,该重新评估了。

旧模型时代的规则困境

上周,OpenAI 发布专文讨论 GPT-6 Astra 中的 Skill、AGENTS.md 和任务 Prompt,开篇就指出:过去一年里,开发者为了让 Coding Agent 得到理想结果,积累了大量指令。但随着模型能力提升,过去需要大量引导才能完成的事情,现在未必还需要。一个典型例子是测试提醒。以往必须明确告诉模型「修改完成以后运行测试,并检查自己的工作」,但 Astra 已经能够主动完成这些步骤。继续保留这类提醒,反而可能导致模型重复测试,增加不必要的操作和延迟。Anthropic 给出的迁移建议同样直接:Claude Opus 5 会主动检查自己的工作成果,如果把给旧模型准备的「完成后再次验证」「反复检查结果」继续留在 Prompt 里,可能会出现过度验证,浪费 Token 并增加响应延迟。这类旧指令可以删掉。

从详细手册到精简导航

需要优化的不只是 Prompt,还有 Skill。OpenAI 指出,当前项目往往会安装多个 Skill,每个 Skill 的名称和 description 都需要进入上下文,帮助模型决定何时调用。但如果 Skill 太多、description 写得冗长,Codex 会对部分描述进行截断以控制上下文长度,最终模型看到的信息反而更少,也更难判断应该选择哪个 Skill。因此,OpenAI 建议将 description 写得尽可能简短,只说明「这个 Skill 做什么、什么时候需要它」。Skill 本身也不必成为一本完整操作手册。如果一个 Skill 包含多个工作流,可以让根目录的 SKILL.md 承担导航作用:告诉模型不同任务应该去哪里找资料、调用哪个脚本,等真正用到某一步时再加载对应内容。OpenAI 将这种方式称为渐进式展开,这与过去「为了保险把所有说明都提前塞进去」的用法截然不同。

AI Coding的成败,不在Prompt堆了多少规则里、不在Skill装了多少内容里,而在是否舍得删掉那些模型早已能自行完成的冗余指令里

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

目标导向替代流程罗列

模型处理模糊信息和细节的能力提升之后,一些过去写成「操作指南」的 Skill 反而会限制模型的发挥。Anthropic 建议,在需要模型进行推理的任务中,优先说明目标和总体要求,减少人为预设的逐步推理流程,让模型自行决定具体的分析和执行路径。以往写 Prompt 经常是「先读取项目目录,然后搜索相关代码,再查看测试文件,制定修改方案,修改代码,运行测试,分析错误……」现在,其中不少步骤可以交给 Agent 自己判断。人需要说清楚的内容开始向另外几个地方集中:我要什么结果、哪些地方不能动、你有哪些权限,以及做到什么状态才算完成。OpenAI 在 Astra 的 Prompt 建议里专门提到,如果希望 Agent 完成实现、运行代码、检查结果、修复问题、再重新测试,最好在开始时就定义清楚完成条件。否则它大概率会做完第一版就回来等待下一步指示。所以 Prompt 的减法,并不等于只留一句「帮我把这个功能做了」。操作步骤可以减少,目标、边界和完成条件反而需要说得更清楚。

管得更少,但管得更严

Mistral 发布的 Studio 最近开始支持管理 Prompt 和 Skill,将这类管理问题摆到了明面上。我们的关注点从「一个 Prompt 应该怎么写」,延伸到了「公司里到底运行着哪个 Prompt」。在它描述的场景里,Prompt 和 Skill 有版本、Owner、生产版本和修改记录,可以从测试状态逐步进入正式环境,也可以追踪某一次行为到底来自哪个版本。这形成了一个有趣的反差:单个 Prompt 和 Skill 在变轻,但围绕它们的管理体系却在变重。模型能够处理的事情越来越多之后,人不需要继续把每个执行步骤写进 Prompt。但当这些 Prompt 和 Skill 真正进入 Agent、进入团队甚至进入生产环境,我们又需要知道它们什么时候被调用、哪个版本正在生效、修改之后有没有让结果变差。Google 在谈及 Agent 质量时也指出,修改一个 Prompt 看几个案例变好了,并不能说明 Agent 整体变好了;每次调整都应该重新回到评测中验证。Prompt 的工作正在换位置:以前花很多时间研究一句话应该怎么写、步骤应该怎么拆,现在还要考虑上下文什么时候加载、旧规则什么时候删除、修改之后该怎么验证。

大模型能力的跃升,正在重新定义人机协作的边界。为弥补旧模型能力不足而积累的规则、每次任务都加载但多数时候用不到的资料,以及模型已能自行判断却仍被写死的执行步骤,这些正是需要减掉的部分。真正需要保留的,是目标、边界、必要上下文和完成条件四件事。当模型能够自主承担测试、验证、反思等任务时,人的角色也在转变:从「一步一步教它做」,变为「告诉它要什么、什么不能碰、做到什么程度算完成」。

#提示词工程#上下文工程#Claude Code#渐进式展开#Skill设计#Agent开发
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信