本页目录6
- 先用Claude Code做原型验证智能体设计,验证可行后再迁移到Agent SDK做生产部署,是一条可复用的开发路径
- 把稳定行为写进编排层的guardrails而不是系统提示词,能省出宝贵的上下文空间,给需要判断力的场景留自由度
- 文件系统读写+bash执行是智能体自主解决问题、维持跨会话记忆的关键基础能力
- 自动化评估套件能把人工复盘一份30分钟成绩单的过程,变成可重复、可加速的检查流程,大幅提升迭代速度
- 面对提示注入等安全风险,采用把智能体当作可能被劫持的'爆炸箱'来设计外围隔离和信任检查点的思路,而不是假设智能体绝对可信
本文是对 Anthropic 官方文章「How Outtake built a cyber investigator on Claude」的中文要点摘要,完整内容以原文为准:https://claude.com/blog/how-outtake-built-a-cyber-investigator-on-claude
背景:Outtake 是谁,要解决什么问题
Outtake 成立于 2023 年,创始人 Alex Dhillon 此前是 Palantir moonshot 团队成员。公司专注 AI 驱动的网络安全防御,2025 年扫描了超过 2000 万起潜在网络攻击,ARR 增长 6 倍,客户数增长超过 10 倍。
传统网络防御工具往往只盯住攻击链的一个环节:威胁情报工具看数据泄露阶段,品牌保护工具看冒充行为,端点安全工具保护内部系统。这些工具各自为战,难以拼出攻击者从「收集数据 → 冒充身份 → 入侵系统」的完整链路。Outtake 想做的是一个能贯穿全链路的统一防御系统,核心产品是「Recon Agent」——一个自主的网络调查智能体。
Recon Agent 能做什么
这个智能体不只是分析数据,还能:
- 读写并执行代码
- 直接与恶意登录页面等可疑站点交互
- 追踪关联基础设施(比如伪造的 Telegram 客服账号)
- 把发现的节点和关系映射进图结构,还原对抗网络
- 自动生成调查报告和威胁行为体(threat actor)档案
据文章描述,该智能体一次调查的中位运行时长约 16 分钟,常规任务可跑超过 1 小时,最长案例达到 2 小时——这类长时间、多步骤的自主运行,是评估其架构设计的重要背景。
从 Claude Code 到 Agent SDK 的四个阶段
Outtake 团队总结了自己的落地路径,对想复用这套经验的团队有参考价值:
- 专业知识积累:工程师先亲自做真实的网络调查,用这个过程定义什么叫「一次好的调查」,把领域专家的判断标准显性化。
- 用 Claude Code 原型验证:利用 Claude Code 自带的代码执行和工具构建能力,快速搭原型、做实验,验证智能体设计思路是否可行。
- 迁移到 Agent SDK 做生产部署:相比原型阶段,Agent SDK 提供了对内存(memory)、上下文和文件系统更细粒度的控制,适合支撑生产级的长周期任务。
- 评估驱动的迭代:搭建自动化评估(eval)套件,把原本靠人工复盘的开发反馈循环大幅提速。
这条「Claude Code 快速验证 → Agent SDK 生产落地」的路径,本身就是一个值得其他团队参考的模式。
几条关键设计原则
编排层严格约束 + 判断力留白。团队的表述是:「在编排层严格限制智能体(比如'调查域名时始终执行 X、Y、Z'),但在需要判断的地方留出自由空间」。也就是说,流程性的、确定性的步骤该写死就写死,不确定、需要经验判断的环节才交给模型自主决策。
提示词是建议,guardrails 才是约束。文章总结的一条实践是「提示是建议」——把你希望智能体稳定遵守的行为,固化进编排层的 guardrails,而不是一股脑塞进系统提示词。这样做既能保护有限的上下文空间,又能让行为更可靠、不依赖模型「记住」提示词里的每一条要求。
工具即自由度。文件系统读写和 bash 执行被视为基础能力——它们赋予智能体持久化记忆(跨步骤、跨会话保留信息)和「遇到障碍时自己想办法绕过去」的空间,而不是每一步都要人工介入。
评估用于加速,而非仅仅把关。团队把评估套件定位为「把 30 分钟的完整调查记录,变成一次可重复的自动化检查」,核心价值是压缩迭代周期,而不只是发布前的质量闸门。
安全与隔离设计
文章提到,选择 Claude 的一个原因是其对提示注入(prompt injection)有较强的抵抗力——这对一个要主动访问恶意网站、与攻击者搭建的钓鱼页面交互的智能体尤为关键。
在架构层面,Outtake 采用了「爆炸箱」(blast box)式的隔离思路:默认假设智能体有可能被劫持或诱导执行非预期操作,因此外围系统的设计目标是控制损害范围,而不是完全依赖智能体自身「不会犯错」。具体做法是在智能体与互联网真正发生交互的那些精确节点上,加入信任检查(trust check)。这种「零信任智能体」的设计思路,对任何需要智能体主动访问不可信外部资源的场景都有参考意义。
结果
据文章介绍,Recon Agent 目前已在生产环境中运行,能够自主开展威胁调查,并把单次冒充事件的线索,逐步追踪、串联成完整的威胁行为体档案。