Agent 不该相信它读到的所有东西
一旦 agent 会用工具,普通的业务内容就成了攻击面——这就是间接提示注入。最容易被跳过、也最便宜的控制手段,是行为监控。
核心要点
- 最便宜却最常被跳过的控制:行为监控。有点尴尬,因为它也是最便宜的——大多数 agent 框架和可观测性方案默认就能产出 trace。
- 缺的不是 trace,是有人真的去看。不是看平均延迟或总 token 成本(那些在仪表盘上自己会报警),而是看具体异常。
- 该盯的三个信号:① 某个平时 3 次工具调用就能完成的任务,这次用了 20 次;② 输出通过了可用性检查,但含一个 agent 不该生成的 URL;③ 检索到的文档里有一段文字读起来像指令不像内容。
- 攻击面变了:现在它包含了业务记录的内容、共享文档、邮件正文。
- 不算新东西:最小权限、输入校验、行为监控——应用安全用了几十年。变的是攻击面的位置。
◇ 对你的项目意味着什么
agent 上线必须配 trace 审查,而且要有明确的人负责看。这一条成本极低,跳过它的代价极高。