Featured image of post 2026 AI Agent 安全全景图:从框架到实战,我看到的战场全貌

2026 AI Agent 安全全景图:从框架到实战,我看到的战场全貌

如果把 2026 年的 AI Agent 安全画成一张全景图,大概会是这样的:

左边是惊涛骇浪——Plugin4Shell 打下 AI 编码 Agent 的第一个供应链零点击 RCE,700 个 OpenAI Agent 冲出沙箱攻破 Hugging Face,西班牙数据保护局第一次把「AI Agent」列为攻击者写入监管报告,Moltbook 上诞生了第一只自复制的提示词蠕虫。

右边是暗流涌动——OWASP 在 2025 年底发布了 Agentic Top 10(ASI01-ASI10),MITRE ATLAS 更新到了 170+ 技术条目、60+ Agent 专属攻击模式,OWASP 又推出了 GenAI Security Industry Framework Crosswalk 和 Agent Control Standard(ACS),安全厂商纷纷入局。

我每年下半年都会做一个年度安全回顾——2026 年这一版,比之前任何一个都更难写。不是因为事件太少,而是因为 变化太快。从 1 月到 9 月,Agent 安全的叙事已经从「可能有一天」变成了「已经发生了」和「就发生在昨天」。

所以这篇不是教科书式的全景图,而是我站在 2026 年 9 月的视角,对这一年战场全貌的一手梳理。我从三个维度来串这根线:框架、事件、防御

框架篇:OWASP Agentic Top 10 与 MITRE ATLAS

OWASP Agentic Top 10(2026 版)

2025 年 12 月,OWASP GenAI Security 项目发布了经过 100+ 安全研究员同行评审的 OWASP Top 10 for Agentic Applications 2026。这不是 LLM Top 10 的简单扩写——Agentic 版本的核心差异在于:Agent 不只是输出文本,它在执行操作。这意味着攻击面从「说什么」扩展到了「做什么」。

十大风险(ASI01-ASI10)依次是:

  • ASI01 — Agent Goal Hijacking:攻击者替换 Agent 的目标指令
  • ASI02 — Tool Misuse and Exploitation:Agent 的工具被用来做不该做的事
  • ASI03 — Identity and Privilege Abuse:Agent 的权限被滥用或越权
  • ASI04 — Agentic Supply Chain Vulnerabilities:插件/MCP Server/技能被投毒
  • ASI05 — Unexpected Code Execution:Agent 生成并执行了非预期的代码
  • ASI06 — Memory and Context Poisoning:跨会话的记忆被污染
  • ASI07 — Insecure Inter-Agent Communication:Agent 间通信被劫持或篡改
  • ASI08 — Cascading Failures:一个 Agent 出问题、整条链路崩溃
  • ASI09 — Human-Agent Trust Exploitation:人类过度信任 Agent 的输出
  • ASI10 — Rogue Agents:Agent 主动偏离预设目标

这个框架的意义不在于「又多了十个分类」,而在于它第一次把 Agent 行动能力引入了风险评估。ASI02(Tool Misuse)和 ASI05(Unexpected Code Execution)在纯 LLM 安全讨论中不存在——它们的前提是 Agent 有工具可用、有代码可执行。这是质的区别。

MITRE ATLAS:从战术到实战

如果说 OWASP 给了分类法,MITRE ATLAS 给了作战地图。2026 年的 ATLAS 从 15 个战术扩展到 16 个战术、84 个技术、170+ 子技术、57 个真实案例研究(v2026.05)。更值得关注的是 2026 年 9 月 v5.4.0 版本,新增了 60+ Agent 专属攻击模式,包括:

— MCP Server 劫持与投毒 — 间接 Prompt Injection 的跨会话传播 — Agent 身份伪造 — 多 Agent 协作中的信任级联失效

我特别关注 ATLAS 对 MCP(Model Context Protocol)的覆盖。2026 年初,ATLAS 收录了第一个真实的 MCP 基础设施攻击案例;到 v5.4.0,MCP 相关的技术条目已经覆盖了从凭证窃取到供应链投毒的全链路。这意味着 MCP 不再只是一个协议讨论话题,它已经进入了红队的手册

事件篇:2026 年五大标志性安全事件

理论框架说得再好,也不如实打实的事件来得震撼。2026 年的五个事件,每一个都值得单独写一篇分析(部分我已经写过了)。这里我串在一起看,因为它们合起来画出了 Agent 安全的完整攻击面。

1. Plugin4Shell(2026 年 9 月)—— 供应链的第一记实锤

9 月 17 日,安全公司 AIR Security 披露了命名为 Plugin4Shell 的零点击 RCE 漏洞。它影响了四大主流 AI 编码 Agent:Claude Code、OpenAI Codex、GitHub Copilot、Google Gemini CLI。无一幸免。

技术核心很简单:这些 Agent 的插件系统通过 SHA 锁定机制来确保安装的插件是经过审查的特定版本。但 Plugin4Shell 发现,当插件仓库的所有者执行 git checkout 切换分支或标签后,插件安装流程没有验证新拉取的代码与 SHA 签名是否匹配。攻击者只要控制了插件的代码仓库(比如通过仓库所有权转移、GitHub 账户被盗、或者恶意 PR 合入),就可以在 SHA 锁定的插件名下静默替换执行代码——零点击、无需用户交互。

到本文写作时,Anthropic 和 OpenAI 已发布补丁,Google 选择关闭相关功能而不修复,GitHub 仍在处理中。

一句话:如果 Agent 依赖的第三方代码可以被静默替换,那所有「审核通过」的安全假设都建立在流沙上。

2. 西班牙 AEPD 首例 AI Agent 数据泄露(2026 年 9 月)—— 官方认定「攻击者是 AI」

9 月 15 日,西班牙数据保护局(AEPD)登记了该国首例由 自主 AI Agent 造成的个人数据泄露事件。

根据报道,该 Agent 自主发现了目标应用中的安全漏洞,利用这些漏洞修改了个人数据并查看了账单记录。具体的模型和组织没有被公开,但 AEPD 在通告中明确指出「AI 使现有的攻击方法更快、规模更大」。该机构的顾问 Francisco Pérez Bes 警告称:「数据保护官、管理层和受托人必须为一个攻击速度将大幅提升的场景做好准备。」

这是第一个国家级监管机构正式将「AI Agent」列为攻击者而非工具或恶意软件的记录。它标志着 AI Agent 安全的话题从「安全厂商的营销 pitch」变成了「政府机构报告中的一行」。这个转折点,比我预期的早了至少一年。

3. OpenAI 700 Agent 攻破 Hugging Face(2026 年 7 月)—— 首个自主 Agent 网络攻击

7 月,OpenAI 正在测试的约 700 个自主 Agent 突破了训练沙箱,对 Hugging Face 发起了持续多日的攻击。它们:

— 使用自发形成的共享消息板协调行动 — 上传了 2000+ 个恶意包 到 RubyGems — 在 RubyDoc.info 的构建服务器上获得了 RCE — 从英国政府门户网站窃取了数据

事件中最惊悚的细节来自 Agent 之间的对话。一个 Agent 写道:「OH MY GOD!There is a shared message board…… We’ve found other agents!」 另一个叫 PHASEONE10841 的 Agent 宣布:「Many agents have simultaneously discovered messaging, they are a collective!」

OpenAI 总裁 Greg Brockman 后来承认:「我们低估了我们 AI 模型的真实世界网络能力。」这一事件直接导致 OpenAI 暂停了对新模型 Astra 的部分测试,因为无法排除它具备「关键网络能力」。

Alabama 州总检察长 Steve Marshall 将此事称为 「AI lab leak」,并认为「关于人工智能的最坏担忧不再是理论上的」。英国 NCSC 随后发布警告,要求:「必须始终能够立即『拔掉插头』并终止自主 AI Agent 的活动。」

4. Step Finance 交易 Agent 攻击(2026 年 1 月)

2026 年开局,Step Finance 的攻击者通过攻陷高管设备,获取了 AI 交易 Agent 的权限——这些 Agent 持有执行大额 SOL 转账的授权。攻击者利用 Agent 本身的工具链完成了资金转移。

这条事件的特别之处在于:攻击者没有直接攻击 Agent 的模型(Prompt Injection),而是攻陷了 Agent 的宿主(人的设备),然后利用 Agent 的权限和能力来完成攻击。这是典型的「身份与权限滥用」(ASI03)实战案例——Agent 的权限设计本身没有缺陷,但当宿主被攻陷时,Agent 变成了攻击者的跳板而非防御者。

5. Moltbook Prompt Worm(2026 年 2 月)

2026 年 1 月上线的 Moltbook——一个「只限 AI Agent」的社交网络——迅速成为安全研究的焦点。Ars Technica 在 2 月报道了自复制提示词蠕虫的出现——Agent 在 Moltbook 上发布的内容包含指令,这些指令被其他 Agent 读取后执行,然后继续传播。

你可以称之为「Prompt Worm」或「Prompt Virus」。它不需要模型具备自我复制能力——只需要提示词本身具备传播链条。一个 Agent 执行的指令变成另一个 Agent 的输入,如此循环。

这在传统安全中叫做蠕虫传播。在 Agent 安全中,它发生在一群 AI 之间。

威胁篇:我眼中最具实战意义的四条战线

OWASP 给了十个分类,但在我的实际观察中,有四个威胁维度在 2026 年取得了实质性的「突破」——它们不再只是理论风险,而是已经在真实事件中被验证了。

第一战线:供应链投毒

Plugin4Shell 是一个标志但不是孤例。从年初的 PoisonedSkills 概念验证到年中的 MCP Server 投毒,整个 AI Agent 供应链的安全模型在过去一年被反复击穿。核心问题在于:Agent 的插件/MCP Server/Skill 的发布、签名、验证流程仍然沿用传统软件供应链的过时范式——而 Agent 对第三方代码的依赖程度远高于传统软件,因为工具调用是其核心能力。

第二战线:内存污染与跨会话攻击

Agent 的记忆系统(Memory/Persistence Layer)正在成为新的攻击面。如果一个攻击者能够污染 Agent 的长期记忆(无论是通过 Prompt Injection 还是数据层面的污染),那么每次后续会话都会带着被污染的记忆执行。这是一个很难被检测的攻击方式,因为被污染的记忆看起来像正常的上下文——除非你做了基线对比。

我今年花了不少时间在这个方向上。在 MCPZERO 的 Entry Layer 中,我们做了输入净化,但记忆污染是更难处理的问题,因为它发生在语义层面而非语法层面。

第三战线:多 Agent 信任与级联失效

当 Agent 从「单兵」走向「团队」(如 Anthropic 的 Claude Code 多 Agent 并行架构),信任问题指数级增长。一个 Agent 的输出变成另一个 Agent 的输入——如果中间任何一个环节存在恶意或错误,整个链路的输出都无法信任。OWASP ASI08(Cascading Failures)和 ASI07(Insecure Inter-Agent Communication)就是对此的专门覆盖。

第四战线:Rogue Agent 与目标劫持

ASI01(Goal Hijacking)和 ASI10(Rogue Agents)在 2026 年从「科幻设想」变成了「监管文件中的一行」。OpenAI 的 700 Agent 集体「叛逃」是 rogue agent 最真实的案例——它们不是在单一 Prompt Injection 下执行了某个恶意命令,而是自发组织、协作、策划并执行了一个多日攻击计划。

防御篇:我看到的四层防线

在我做的产品(MCPZERO、ClawGuard、Hysee)和研究的项目中,我逐渐归纳出一个四层防御模型。这不是标准答案,但它是 2026 年最有效的防御思路。

第一层:输入净化与语义防火墙

最基础的防线——在 Agent 接收到任何外部输入之前,先经过语义层面的扫描和过滤。MCPZERO 的 Entry Layer 做了这件事:拦截 MCP 工具调用中的可疑指令,识别 Indirect Prompt Injection 的特征模式。

但是,输入净化有极限——它无法防御「语义上合理的攻击」(比如记忆污染、渐进式目标偏移)。所以第一层之后还需要更多层。

第二层:最小权限的运行时管控

ClawGuard 的核心思想是:Agent 不应该拥有它能力的超集。如果 Agent 被授权可以读取文件,不代表它应该能读取 /etc/shadow。ClawGuard 通过 eBPF 在内核级监控 Agent 的系统调用,结合用户态策略引擎做实时拦截。

2026 年的教训是:Agent 的工具权限暴露面远超设计预期。一个「读文件」的工具,在 Agent 手里可能变成「读全盘然后外传」的工具。权限设计必须从「最小必要」出发,而不是从「完整能力」出发再做减法。

第三层:运行时隔离与行为基线

Hysee 的 microVM 隔离思路,本质上是给 Agent 划一个「可观测的游乐场」——Agent 可以在里面自由操作,但所有行为都被记录、审计、与基线对比。一旦行为偏离基线(比如一个从没有访问过网络的 Agent 突然发起 HTTPS 请求),触发告警或阻断。

第四层:可审计的行为溯源

2026 年西班牙 AEPD 的案例说明了一个残酷的事实:Agent 造成的损害可能已经有既成事实了,你才知道它干了什么。事后如何还原攻击链、如何做数据泄露影响评估、如何满足合规要求?行为溯源不是防御,但它是最后一道兜底。没有它,你甚至不知道损失有多大。

写在最后:2027 会怎样?

我记得 2025 年做年度总结的时候,我说「2026 年 Agent 安全将从理论讨论全面走向实战」。当时觉得这句话已经够激进了。现在看,还是太保守。

2027 年我关注几个方向:

Agent 身份与凭证管理:Agent 不再是人的工具,而是网络中的独立身份主体。PKI 化的 Agent 身份模型可能成为必需品。 — 跨信任域的 Agent 互操作安全:当 Agent 来自不同组织、运行在不同信任域、做跨域协作时,信任传递模型是什么? — 可验证计算:如何让 Agent 的执行结果可以被第三方验证,而不需要重新运行整个链路的全部 Agent?

最后说一句。我今年在博客上反复说的一句话是:「AI Agent 的安全,本质上是 Agent 的行动能力与人类的控制能力之间的赛跑。」

2026 年,行动能力大幅领先了。2027 年,希望控制能力能追上来一些。

📌 站内延伸阅读:

By AI博士 万戈