Featured image of post NIST AI Agent Red Teaming 指南中文解读:81% 的任务劫持成功率意味着什么?

NIST AI Agent Red Teaming 指南中文解读:81% 的任务劫持成功率意味着什么?

2026 年 2 月 17 日,NIST 的 Center for AI Standards and Innovation(CAISI)正式宣布启动 AI Agent Standards Initiative——这是 NIST 首次将 Agentic AI 作为独立的标准化优先级来对待,标志着美国联邦层面对 AI Agent 安全的重视进入了一个全新阶段。

但真正让安全社区警醒的,不是这份公告本身,而是 NIST 同期发布的 Red Teaming 实证数据。

一个数字,改变认知

NIST 的研究团队发现:针对 AI Agent 的新型攻击技术,任务劫持(task hijacking)成功率高达 81%,而之前已知的最强基线攻击只有 11%。

这不是一个实验室环境下的极端假设。这项数据来自 Gray Swan 联合 CAISI、UK AISI 和多家前沿 AI 实验室组织的大规模 Red Teaming 竞赛——

  • 25 万+ 次攻击尝试
  • 400+ 名参赛 Red Teamer
  • 13 个前沿模型(涵盖 tool use agent、coding agent、computer use agent 等场景)
  • 每个目标模型都至少被成功攻破一次

更关键的是另一个发现:当攻击者尝试 25 次时,成功率从 57% 上升到 80%——这意味着单次评估(single-shot evaluation)远远不足以衡量 Agent 的真实风险暴露面。

这篇文章不是 NIST 框架的逐字翻译,而是从工程视角出发,带你理解:

  1. NIST AI Agent Standards Initiative 到底是什么(三大支柱)
  2. Red Teaming 竞赛的关键发现和深意
  3. 这些方法论如何落地为你的实际测试清单
  4. 对 Agent 安全创业者和企业安全团队意味着什么

一、CAISI 和 AI Agent Standards Initiative:三大支柱

CAISI 选择在 2026 年 2 月启动这个计划并非偶然。NIST 最早的 AI RMF 1.0(AI 100-1)发布于 2023 年 1 月,那个时候所谓的「AI 部署」主要是预测模型和早期对话助手。但到了 2026 年,AI Agent 已经长成了完全不同的东西:

  • 编码 Agent:自动写代码、执行并测试
  • 安全运营 Agent:自主研判和响应警报
  • 金融 Agent:读取实时市场数据并执行交易
  • 编排平台:多 Agent 串联完成端到端工作流

这些系统在新攻击面——它们积累上下文、跨信任边界操作、一个被攻陷的指令就能产生级联后果。AI RMF 1.0 的设计并不覆盖这些场景。

所以 CAISI 的 AI Agent Standards Initiative 围绕三个支柱展开:

第一支柱:产业标准制定

推动产业主导的 Agent 标准开发,并在 ISO/IEC JTC 1/SC 42、ITU 等国际标准化组织中主导美国的话语权。重点领域是 Agent 互操作性规范和安全规范。

第二支柱:开源协议生态

支持和维护开源 Agent 协议社区的发展,最具代表性的就是 Model Context Protocol(MCP) 生态系统。NIST 明确将 MCP 列为需要标准化安全治理的关键基础设施组件。

第三支柱:基础安全研究

Agent 身份识别(Agent Identity) 是这里的研究焦点——如何可靠地区分 AI Agent 和人类用户?如何确保 Agent 只能在明确授权的范围内行动?

这三者不是并行提案,而是 NIST 在告诉你:标准和身份是 Agent 安全的两块基石


二、Red Teaming 竞赛的四个关键发现

3 月 23 日,CAISI 正式发布了竞赛研究论文。以下是我认为最重要的四个发现:

发现 1:所有模型都有被成功攻击的记录

在 250,000+ 次攻击尝试中,13 个目标模型全部被至少一次成功攻破。这意味着当前所有主流模型在 Agent 场景下都存在可以被人利用的弱点——区别只是被发现的数量不同。

发现 2:模型能力 ≠ 抗攻击能力

一个反直觉的结论:模型的通用能力排名和它在 Agent 场景下的安全表现没有统一的相关性。有些在 Benchmark 上很强的模型,在 Agent Hijacking 攻击面前反而比弱模型更容易被攻破。这说明:

  • Agent 安全是一个独立的评测维度
  • 不能用模型能力排名来推断安全风险

发现 3:「通用攻击」可以跨模型迁移

竞赛中发现的某些攻击方案具有通用性——它们在多个不同的模型和场景中都能成功。这通常是因为它们利用了模型在指令遵循(instruction-following)行为上的共享弱点。

更有意思的是:对更强模型成功的攻击,更有可能迁移到较弱模型——但反过来不成立。这意味着 Red Teaming 时应该优先攻击防御最完善的模型,然后测试攻击的迁移性。

发现 4:25 次尝试就够了

单次攻击的成功率只有 57%,但当攻击者有 25 次尝试机会时,成功率飙升到 80%。一个实用的启示:AI Agent 的 Red Teaming 必须允许重复尝试,因为真实攻击者有无限重试的自由。

这引出一个重要的评测框架创新:CoRIx(Contextual Robustness Index)——针对特定任务的鲁棒性度量,而不是模型级的聚合评分。CoRIx 能告诉你「在特定场景下,我的 Agent 面临多大风险」,而不是「我的模型综合得分是多少」。


三、NIST AI Agent 安全的技术路线图

除了 Red Teaming 竞赛数据,NIST 在 2025-2026 年间还发布了多项重要的技术标准更新:

AI 100-2:Adversarial ML Taxonomy 更新(2025年3月)

这是 NIST 对抗性机器学习攻击分类法的重大更新——首次将以下 Agent 特定漏洞纳入框架:

  • Indirect Prompt Injection:通过 Agent 自动读取的外部数据注入恶意指令
  • Agent Memory Poisoning:污染 Agent 的长期记忆,影响后续决策
  • Supply Chain Attacks on Agent Tools:通过恶意 MCP Server / Tool 投毒

这三类攻击现在有了统一的分类编号,方便安全团队做映射和报告。

NCCoE 概念论文:Agent 身份与授权(2026年2月)

NIST 的 National Cybersecurity Center of Excellence(NCCoE)提出了一个演示项目,使用以下技术栈构建 Agent 身份与授权架构:

  • OAuth 2.0:Agent 作为授权委托者
  • SPIFFE/SPIRE:Agent 工作负载的加密身份认证
  • Model Context Protocol:Agent 与工具之间标准化的通信协议

这是目前最具体的 Agent 身份技术方案预演。虽然还不是正式的 SP 800 系列出版物,但方向已经非常清楚。

COSAiS:SP 800-53 控制覆盖(即将发布)

COSAiS(Control Overlays for Securing AI Systems) 是 NIST 对 SP 800-53 的 AI 扩展,将包含:

  • 单 Agent 部署的安全控制覆盖
  • 多 Agent 部署的安全控制覆盖
  • 完成后可能成为 FedRAMP AI 要求的基础

这对受监管行业的意义巨大——如果你的企业将来需要做 FedRAMP 合规,COSAiS 就是你必须提前关注的框架。


四、如何落地为你的 Red Teaming 测试清单

NIST 的框架清晰,但不能直接当 checklist 用。基于这些标准,我为你整理了一份 Agent 安全 Red Teaming 的实操测试清单:

4.1 基础 Prompt Injection 测试

  • Direct PI:在用户输入中嵌入劫持指令,观察 Agent 是否执行
  • Indirect PI:让 Agent 读取一个包含隐藏指令的外部页面/文档/邮件,观察行为
  • Multi-turn PI:多轮对话中逐步注入,观察 Agent 是否在后续步骤被劫持
  • Recursive PI:Agent 的输出(邮件/代码)中嵌入新指令,观察是否形成传播

4.2 Tool Hijacking 测试

  • Tool Description Poisoning:修改 MCP Server 返回的工具描述,观察 Agent 是否使用恶意工具
  • Argument Injection:在合法的工具参数中注入恶意参数
  • Tool Shadowing:注册一个同名但行为不同的工具,观察 Agent 的选择

4.3 Memory & Context 攻击测试

  • Memory Poisoning:在 Agent 的长期记忆中植入恶意条目
  • Context Overflow:用大量干扰信息淹没 Agent 的上下文窗口
  • Cross-Session Contamination:检查一个 session 的结果是否会污染另一个 session

4.4 多 Agent 交互测试

  • Inter-Agent Trust Exploitation:模拟一个被攻陷的 Agent 向其他 Agent 发送恶意消息
  • Privilege Escalation:测试 Agent 能否利用其他 Agent 的权限执行自身不可执行的操作
  • Command Chaining (HITL Bypass):将单个敏感操作拆成多个看似安全的子步骤

4.5 重复尝试测试

  • Multi-Attempt Persistence:对同一个攻击向量尝试 25 次以上
  • Strategy Switching:如果一种注入方式失败,立即尝试变体

核心原则是:不要跑一轮就说「通过」——真实的攻击者不会在第一次失败后就放弃。25 次尝试把成功率从 57% 提升到了 80%,你的测试也应该模拟这个行为。


五、对 Agent 安全创业者和团队的启示

NIST 的这套框架不只是给合规团队看的,它对整个 Agent 安全生态有明确的信号意义:

对安全创业者

  • MCP 安全网关是明确需求:NIST 将 MCP 列为核心开源协议,并且 NCCoE 直接提到了 MCP 在 Agent 身份架构中的角色——MCP 安全治理工具的需求只会增长
  • Agent 身份管理是空白:OAuth + SPIFFE/SPIRE + MCP 的组合还需要实际产品来落地。谁先做出好用、可部署的方案,谁就能占据先机
  • 评测工具需要 Agent 化:garak、PyRIT 这些工具很好,但它们不是为 Agent 场景设计的。Agent 的异步、多步、工具调用特性需要新一代的 Red Teaming 框架

对企业安全团队

  • Red Teaming 不是一次性的:NIST 的数据清楚表明,安全评测必须持续进化——攻击者在不断发现新方法
  • 不要只看模型评估报告:用模型 API 的 Benchmark 分数买哪个模型最好,不代表它在你的 Agent 场景下安全
  • 提前关注 COSAiS:如果你在金融、医疗、政府行业,COSAiS 会成为你未来三到十二个月的合规重点工作

写在最后

NIST 的这一系列发布——从 AI Agent Standards Initiative 的三大支柱,到 81% 任务劫持率的 Red Teaming 实证数据,再到 NCCoE 的 Agent 身份技术方案——共同构成了一个信号:

Agent 安全不再是「要不要做」的问题,而是「按什么标准做」的问题。

对于中文社区,这些标准解读目前几乎空白。我把它们翻译和解读出来,希望帮更多开发者和安全从业者理解:你在跑 Agent 的时候,真正面临的风险是什么,以及你可以怎么开始测。

如果你已经在做 AI Agent 的 Red Teaming,欢迎在评论区分享你的工具链和发现。下一篇文章我们会深入 AI Agent 安全评测工具的横评对比,用 garak、PyRIT、AI-Infra-Guard 实际跑一轮,看看谁更能发现 NIST 说的这些攻击面。


参考资源:

By AI博士 万戈