本页目录5
这个考点是什么
agent 在自主运行时会不断遇到两类边界:一类是任务本身是否已经超出了它该独立处理的范围(该不该 escalate 给人类),另一类是输入或情境本身不明确(该不该先澄清、还是可以合理假设后继续推进)。5.2 考的就是如何把这两类判断标准化、显性化,而不是依赖模型自身对“我有多大把握”的主观感觉。
核心思路是“用明确触发条件替代拍脑袋”。好的升级设计不是给一条模糊指令(比如“遇到复杂情况就转人工”),而是把“复杂情况”拆解成可判定的条件清单——是否涉及政策例外、是否客户明确要求人工、是否触及金额或权限阈值等,并配上正反两类例子(few-shot)训练模型对齐这条边界。
校准误差可能是双向的:既可能把简单、标准化的案例也升级出去,也可能让 agent 硬扛本该转人工的复杂案例。
另一半是对“用户已经明确表态”这件事的态度。一旦用户明确提出要转人工,这个请求本身就应立即被尊重,不需要 agent 先自证“我能不能搞定”——这体现的是尊重用户自主选择权的原则,和 agent 技术上是否具备解决能力无关。歧义处理与此相邻但不同:遇到意图不明确的输入,恰当做法通常是先澄清或明示假设,而不是悄悄替用户做决定后直接执行。
为什么考
常见出题角度之一:给出 agent 的表现数据(例如首次解决率远低于目标),让考生诊断根因是升级边界没校准,再从“加置信度阈值 / 训练 ML 分类器 / 加情感分析 / 加显式判断标准+few-shot”中选出成本最低、直接命中根因的修法。
干扰项常利用“听起来更高级但引入了新的不可靠信号”这类陷阱,比如 LLM 自报置信度本身缺乏校准,情绪强度和案例复杂度也并无因果关系。
另一种常见出题角度:给一段对话,agent 明明有能力解决但客户已经明确要求转人工,考察是否应该先完成能力自证的动作。正确答案始终是立即尊重明确请求,而不是“帮完这一步再转”或“先判断情绪强度再决定”,干扰项往往就是对当前错误行为的另一种包装。
核心辨析
- 1
升级边界要用“可判定的显式条件”定义,不要依赖模型自报的置信度
LLM 的置信度表达本身缺乏校准,尤其容易在真正复杂(如涉及政策例外)的场景里过度自信,拿置信度阈值当路由信号,恰好会在最该转人工的地方失灵。
- 2
用户一旦明确说出要转人工,这个请求本身就是充分且立即生效的触发条件,不需要 agent 先完成手头的调查或步骤来自证有没有能力处理。是否具备解决能力,和是否应该尊重用户已表达的偏好,是两件不相关的事。
- 3
升级校准误差是双向的
既包括把简单、有明确标准操作(如有照片证据的标准换货)的案例也转给人工(过度升级,拉低自主解决率、拖慢体验),也包括让 agent 自己硬扛需要政策判断或例外授权的复杂案例(升级不足,带来错误决策风险)。诊断时先看清是哪个方向的失衡,再对症下药。
- 4
修复方案要按“能解决问题的最小机制”来选,不要一上来就上重型方案
多数升级校准问题的根因是判断标准本身模糊,加显式判断标准加正反两类 few-shot 示例通常就够;需要历史标注数据和训练/serving 基础设施的方案(如单独训练一个分类器)只在前者验证不够时才该考虑。
- 5
不是所有看起来相关的信号都真的和该不该升级挂钩
客户语气里的沮丧或不耐烦本身不等于案例复杂或需要政策例外——除非客户由此明确提出转人工请求,否则单纯的情绪强度不构成升级的充分条件,拿它当路由依据是在解决错误的问题。
- 6
升级和歧义处理是相邻但不同的边界
遇到意图不明确的输入,该做的通常是先向用户澄清或明确说明自己将采用的假设,而不是替用户悄悄做假设直接执行——尤其当后续动作代价较高或难以撤销时,“先确认再执行”本身就是恰当的暂停,而不是缺陷。
反模式对照
用 agent 自报的置信度分数作为是否转人工的判断依据
在 system prompt 里写明确的升级条件清单(案例类型、是否涉及政策例外、金额或权限阈值等),并用正反 few-shot 示例校准边界
LLM 的自我置信度表达缺乏校准,恰恰容易在最复杂、最该转人工的场景里表现得“很自信”,拿它当阈值信号等于在系统最脆弱的地方引入新的不可靠性。
客户已经明确要求转人工后,agent 仍先完成自己能搞定的调查或操作步骤,等做完再转
一旦识别到客户明确表达了转人工的诉求,立即停止自主操作并升级,不以“反正我能力上能处理”为由拖延
是否有能力解决和是否应该尊重用户已表达的选择是两个独立维度,后者优先级更高,拖延本身就是让客户重复请求的原因。
用客户语气的情绪强度(如是否听起来沮丧、不耐烦)作为触发转人工的信号
只在真正相关的信号上定义升级条件——是否明确要求人工、是否涉及需要人工裁量的政策例外等
情绪强度和案例本身是否复杂、是否需要政策例外之间没有可靠的因果关系,用错信号解决的是另一个问题。
一发现升级校准不准,就直接上历史数据训练的分类器或额外的 ML 打分服务
先尝试成本最低的修复——把隐含标准显式写清楚并配上例子,验证效果后再考虑更重的方案
多数校准问题根因是提示词里判断标准不够具体,重型方案在标准都没写清楚时只是徒增维护和基础设施成本,不解决根本问题。
练这个考点
练习模式支持按考点专练(需 Google 登录,不占用正式考机会)。
专练考点 5.2