菜单
积墨AI

积墨AI

四步让AI评估准确率从50%飙升至97%的实战方法论

从50%到97%:腾讯客服团队AI评估智能体的迭代复盘

在企业AI落地的过程中,一个常见的困境是:AI生成答案并不难,难的是让它在真实业务场景中稳定输出可靠结果。很多团队在初步尝试AI后,发现准确率始终在低位徘徊,反复修改提示词却收效甚微,最终对AI应用失去信心。

腾讯客服知识资产团队的真实经历提供了一个可参考的样本:他们耗时五个月、经历101次迭代,将AI评估智能体的准确率从50%提升至97%。这一成果的取得,并非依赖某条“万能提示词”,而是团队在实践中逐步摸索出的一套四步方法论。


第一步:学会筛选——明确什么值得交给AI处理

许多团队在引入AI时,倾向于将所有历史文档、规则手册和经验记录一股脑塞入知识库,期待AI能够“消化”这些内容并自动产出价值。这种做法忽视了一个关键问题:经验资产中往往混杂着真正有效的判断逻辑和早已过时的固定流程。

未经筛选就全量输入,可能导致AI更快地执行一套本可简化甚至取消的工作流程。真正有效的做法是在沉淀知识之前,先完成一轮筛选和优化:

  • 这项工作真正要解决的核心问题是什么?
  • 现有环节是否仍有存在的必要?
  • 哪些内容属于固定流程,哪些需要结合实际情况判断?
  • 哪些经验会反复使用,值得沉淀为统一标准?

先优化流程,再决定AI应该介入哪些环节。AI可以将一件事做得更快,但它不会主动提醒你这件事本来可以不做。


第二步:学会提问——用苏格拉底式追问挖掘隐性知识

确定AI应该处理的任务后,下一个难点是如何将人的判断经验清晰表达出来。直接要求AI“帮我整理业务规则”或“写一份操作指南”,通常会得到一份结构完整但缺乏实质信息的文本。

问题出在哪里?知识沉淀最大的难点,不是不知道如何表达,而是许多关键经验从一开始就没有被说出来。对于熟悉业务的人来说,某些判断早已成为下意识。他知道应该关注什么,却很难意识到自己省略了哪些“不言自明”的部分。而这些部分,不说出来,AI就永远不知道。

有效的做法是调转顺序:不让AI直接开始写,而是先让它提问。可以借鉴苏格拉底式提问法,让AI扮演一个不了解业务、但会持续追问的采访者。AI不需要急着给出答案,而是先围绕任务目标、判断条件、规则优先级、特殊情况等信息不断提问,将原本没有说出口的信息逐步挖掘出来。

这种方式的核心理念是:越熟悉一项工作,越难还原尚未掌握时的状态,越会不自觉地省略最需要的信息。“这种情况看着办”究竟是什么情况?“实在不行就上报”什么情况才算实在不行?与其一个人面对空白文档反复回忆,不如让AI学会反问。

实操提示词模板:【苏格拉底式采访】我是[你的角色],正在做[具体业务]。我想把[某项判断经验]沉淀成[新人/系统]能照着独立执行的知识。接下来请你用苏格拉底式提问来采访我。规则:1. 你只提问,我来答,不要替我下结论;2. 每次只问一个问题;3. 我的回答一旦含糊,你要顺着追问直到把具体条件问出来;4. 直到换个完全不懂的人照着也能做出同样判断为止。现在先问我第一个问题。


第三步:学会管理——建立AI操作权限边界

知识框架搭建完成后,随着业务变化,判据、阈值和输出话术需要持续更新。真正容易被忽略的风险,往往发生在修改过程中。

知识库不是一组彼此独立的文档,而是一张相互关联的规则网。修改其中一条规则,可能影响其他判断。AI在执行修改时,也可能根据自己的理解“顺手优化”相关内容,而这些额外改动不一定会被明确标出。

因此,校验工作需要提前进行,需要建立三条核心规则:

规则一:先列出清单,再执行修改 收到修改任务后,AI不能立即写入,而要先列出完整的改动清单:准备修改哪个文件、哪一部分;对应的原文是什么;计划修改成什么;为什么需要修改。使用者逐条检查并确认后,AI才能开始执行。

规则二:只修改确认过的内容 改动范围一旦确认,清单之外的内容一律不动。即使AI在分析过程中发现了“似乎可以顺手优化”的内容,也不能擅自修改。该改的没改到是执行问题,没有要求修改的内容被改动则可能引入更难发现的新问题。

规则三:遇到冲突先停止 如果修改规则A会影响规则B,AI不应该自行决定如何取舍,而要先停下来向使用者说明冲突位置、问题性质和可能影响,再等待使用者决定。AI可以识别冲突、分析影响和提出方案,但最终选择仍然由人作出。

实操提示词模板:【全局同步修改协议】在着手修改任何文档之前,必须严格遵循以下协议:1. 全域预检:检查修改内容是否与现有逻辑冲突,是否导致语义模糊;2. 最小必要原则:只纠误不改对,严格限定修改范围;3. 跨文档冲突熔断机制:发现冲突立即停止,输出全景报告,等待授权;4. 原子化提交:确保所有相关修改在同一轮完成,保证逻辑一致性。


第四步:学会归因——先定位问题再优化提示词

完成知识沉淀后,下一步是让AI进入真实任务并稳定执行,再根据真实错误案例一步步校准。准确率提升的关键在于:每一轮都解决一个能够被明确说明的问题。

腾讯客服团队将错误原因归纳为五类:

  • 知识没有写清楚:关键条件缺失或表述含糊,需要回到知识库补充
  • 规则顺序不清楚:多条规则同时命中但没有说明优先级,需要调整判断顺序
  • 输入信息不足:现有信息不足以支持结论,需要增加“信息不足”的退出条件
  • 输出没有遵守要求:判断正确但格式、字数或话术不符合要求,需要收紧输出约束
  • 模型幻觉或不稳定:AI添加了没有依据的信息,或在相似输入下给出不一致结果

这一步不能跳过。如果没有先判断问题发生在哪一层,就直接修改提示词,很容易把知识问题写成提示词补丁,导致提示词越来越长,真正缺失的判断条件却仍然没有被补上。

错误归因优化流程

  1. 定位具体语句:指出是哪一句读取的提示词导致了这个结果,引用原句
  2. 归因分类:只能取一类(A1表述缺失、A2知识缺失、B顺序不清、C输入不足、D输出违规、E大模型幻觉)
  3. 判断该不该改:A2类应该先补知识库条目,案例输入自相矛盾时应改测试案例而非提示词
  4. 给出修改方案:明确改哪一句、改成什么、预期效果

修改确认流程

AI提出修改建议后,不能直接全部写入。要让AI先把三件事说清楚:要改什么(明确文件、章节、原文和新版本);为什么要改(每项改动对应哪个具体错因);改动之间是否存在冲突。确认清单需要逐条审批,而非整体批准,这样可以保留必要改动,拒绝与本轮问题无关的调整。

实操提示词模板:【提示词优化与修改确认指令】先列出修改方案清单,等我逐条确认后再动手。每条必须包含:修改位置(文件名+小节名+原句)、改为(完整修改后内容)、预期效果(改完后案例如何走到正确结论)。逐条说明每条改动解决的是哪个具体问题。自行排查改动之间的冲突并单独报告。清单之外的任何内容一律不许动。


迭代闭环:持续优化的关键机制

从50%到97%的准确率提升,核心在于固定执行一套迭代闭环:建立基线、定位错误、最小修改、全量回归、留下记录。

每一轮迭代只解决一个能够被明确说明的问题。当同一个问题修改三四轮仍然没有解决,甚至越改越乱时,应该暂停修改,让AI回顾整条任务链路,找出卡点到底在哪里——是指令有歧义,还是任务本身存在冲突。只有先找到反复失败的原因,后续修改才不会继续建立在错误的方向上。

任务深度复盘协议:启动全链路梳理,按时间线还原任务执行每一步;可行性重估,重新审视任务目标在当前条件下的可行性;根因分析,重点分析中途失败的具体节点,区分“技术执行失误”与“任务逻辑设计缺陷”;流程诊断,指出哪些提问方式、干预手段或反馈机制不合理;记忆固化,将关键教训整理成执行备忘录,供后续同类任务参考。


写在最后

我们常常把AI的使用效果归因于提示词的质量:答案不够准确就继续补充要求,执行不够稳定就尝试写出更长更完整的指令。但真实工作往往包含大量隐性条件、规则边界和例外情况,很难通过一次输入全部说明。

更有效地使用AI,不是追求一次性写出完美指令,而是建立一套可以持续运行的协作方法:先判断哪些任务真正适合交给AI,再通过追问将隐性经验转化为明确的条件和规则;执行过程中限制修改范围、保留人工确认;出现错误后,根据具体原因进行最小调整和完整验证。

当任务目标、判断依据、操作边界和反馈机制都足够清楚,AI才不只是一个能够生成答案的工具,而会逐步成为一个更可靠、更有效的协作者。这套四步方法论的核心价值,不在于某一次修改带来的提升,而在于建立了一套可持续迭代、持续优化的机制,让AI的能力在真实业务场景中不断逼近最优解。

#提示词优化#苏格拉底式提问#知识沉淀#错误归因#迭代闭环
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信