CCA-F 练习题库· Context Management & Reliability
某抽取流水线的平均准确率很高,但团队希望做基于置信度的路由:高置信度的抽取结果自动放行,低置信度的转人工审核。一位开发者提议直接把模型给出的置信度分数当作路由阈值使用。这种做法的关键缺陷是什么?
- A置信度分数会给每一个抽取响应都增加额外的输出 token,在高吞吐的流水线上这笔开销会推高每月的 API 账单,却抽不出任何额外的字段值。
- B置信度分数只有在模型每次响应只输出单个抽取结果时才有效;多字段文档只会给出一个覆盖整份输出的分数,因此按字段路由需要另一种方法。
- C模型的置信度分数必须针对一个带标注的验证集进行校准,才能确定哪个分数阈值实际对应可接受的准确率。未经校准的原始分数并不是抽取正确性的可靠预测指标。
- D按置信度做路由会产生两条独立的代码路径——自动通道和人工审核通道——两条都要分别测试并保持同步,比单一统一的审核工作流更难维护。
正确答案:C
解析
- C正确。关键缺陷在于:模型自述的(原始)置信度分数通常是未经校准的——像 0.9 这样的自报分数并不在经验上对应 90% 的抽取准确率,因此把这类分数直接当作路由阈值,对自动放行那一部分结果的实际准确率毫无保证。要安全地做基于置信度的路由,你必须用带标注的验证集来校准这些分数,以找出哪个分数阈值实际映射到团队可接受的准确率水平。
- A(额外的 token/成本)是一个无关痛痒的顾虑,而不是正确性缺陷;
- B是错的,因为置信度可以逐字段给出,所以多字段文档并不会破坏这种做法;
- D描述的是常规的工程/可维护性权衡,而非可靠性缺陷。
延伸阅读
本题为本站自有原创练习题,非任何官方考试内容;解析对照 Anthropic 公开文档撰写, 如与最新文档不符请以官方为准。想在限时环境下检验水平,可参加 模拟考(题目与本页题库不重叠)。