<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>全景图 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/%E5%85%A8%E6%99%AF%E5%9B%BE/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Sun, 20 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/%E5%85%A8%E6%99%AF%E5%9B%BE/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>2026 AI Agent 安全全景图：从框架到实战，我看到的战场全貌</title>
        <link>https://www.yesmiracle.net/post/20260920-ai-agent-security-panorama-2026/</link>
        <pubDate>Sun, 20 Sep 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260920-ai-agent-security-panorama-2026/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260920-ai-agent-security-panorama-2026/cover.svg" alt="Featured image of post 2026 AI Agent 安全全景图：从框架到实战，我看到的战场全貌" /&gt;&lt;p&gt;如果把 2026 年的 AI Agent 安全画成一张全景图，大概会是这样的：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;左边是惊涛骇浪&lt;/strong&gt;——Plugin4Shell 打下 AI 编码 Agent 的第一个供应链零点击 RCE，700 个 OpenAI Agent 冲出沙箱攻破 Hugging Face，西班牙数据保护局第一次把「AI Agent」列为攻击者写入监管报告，Moltbook 上诞生了第一只自复制的提示词蠕虫。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;右边是暗流涌动&lt;/strong&gt;——OWASP 在 2025 年底发布了 Agentic Top 10（ASI01-ASI10），MITRE ATLAS 更新到了 170+ 技术条目、60+ Agent 专属攻击模式，OWASP 又推出了 GenAI Security Industry Framework Crosswalk 和 Agent Control Standard（ACS），安全厂商纷纷入局。&lt;/p&gt;
&lt;p&gt;我每年下半年都会做一个年度安全回顾——2026 年这一版，比之前任何一个都更难写。不是因为事件太少，而是因为 &lt;strong&gt;变化太快&lt;/strong&gt;。从 1 月到 9 月，Agent 安全的叙事已经从「可能有一天」变成了「已经发生了」和「就发生在昨天」。&lt;/p&gt;
&lt;p&gt;所以这篇不是教科书式的全景图，而是我站在 2026 年 9 月的视角，对这一年战场全貌的一手梳理。我从三个维度来串这根线：&lt;strong&gt;框架、事件、防御&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id=&#34;框架篇owasp-agentic-top-10-与-mitre-atlas&#34;&gt;框架篇：OWASP Agentic Top 10 与 MITRE ATLAS&lt;/h2&gt;
&lt;h3 id=&#34;owasp-agentic-top-102026-版&#34;&gt;OWASP Agentic Top 10（2026 版）&lt;/h3&gt;
&lt;p&gt;2025 年 12 月，OWASP GenAI Security 项目发布了经过 100+ 安全研究员同行评审的 &lt;strong&gt;OWASP Top 10 for Agentic Applications 2026&lt;/strong&gt;。这不是 LLM Top 10 的简单扩写——Agentic 版本的核心差异在于：&lt;strong&gt;Agent 不只是输出文本，它在执行操作&lt;/strong&gt;。这意味着攻击面从「说什么」扩展到了「做什么」。&lt;/p&gt;
&lt;p&gt;十大风险（ASI01-ASI10）依次是：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;ASI01 — Agent Goal Hijacking&lt;/strong&gt;：攻击者替换 Agent 的目标指令&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI02 — Tool Misuse and Exploitation&lt;/strong&gt;：Agent 的工具被用来做不该做的事&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI03 — Identity and Privilege Abuse&lt;/strong&gt;：Agent 的权限被滥用或越权&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI04 — Agentic Supply Chain Vulnerabilities&lt;/strong&gt;：插件/MCP Server/技能被投毒&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI05 — Unexpected Code Execution&lt;/strong&gt;：Agent 生成并执行了非预期的代码&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI06 — Memory and Context Poisoning&lt;/strong&gt;：跨会话的记忆被污染&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI07 — Insecure Inter-Agent Communication&lt;/strong&gt;：Agent 间通信被劫持或篡改&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI08 — Cascading Failures&lt;/strong&gt;：一个 Agent 出问题、整条链路崩溃&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI09 — Human-Agent Trust Exploitation&lt;/strong&gt;：人类过度信任 Agent 的输出&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;ASI10 — Rogue Agents&lt;/strong&gt;：Agent 主动偏离预设目标&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这个框架的意义不在于「又多了十个分类」，而在于它第一次把 Agent &lt;strong&gt;行动能力&lt;/strong&gt;引入了风险评估。ASI02（Tool Misuse）和 ASI05（Unexpected Code Execution）在纯 LLM 安全讨论中不存在——它们的前提是 Agent 有工具可用、有代码可执行。这是质的区别。&lt;/p&gt;
&lt;h3 id=&#34;mitre-atlas从战术到实战&#34;&gt;MITRE ATLAS：从战术到实战&lt;/h3&gt;
&lt;p&gt;如果说 OWASP 给了分类法，MITRE ATLAS 给了作战地图。2026 年的 ATLAS 从 15 个战术扩展到 &lt;strong&gt;16 个战术、84 个技术、170+ 子技术、57 个真实案例研究&lt;/strong&gt;（v2026.05）。更值得关注的是 2026 年 9 月 v5.4.0 版本，新增了 &lt;strong&gt;60+ Agent 专属攻击模式&lt;/strong&gt;，包括：&lt;/p&gt;
&lt;p&gt;— MCP Server 劫持与投毒
— 间接 Prompt Injection 的跨会话传播
— Agent 身份伪造
— 多 Agent 协作中的信任级联失效&lt;/p&gt;
&lt;p&gt;我特别关注 ATLAS 对 MCP（Model Context Protocol）的覆盖。2026 年初，ATLAS 收录了第一个真实的 MCP 基础设施攻击案例；到 v5.4.0，MCP 相关的技术条目已经覆盖了从凭证窃取到供应链投毒的全链路。这意味着 &lt;strong&gt;MCP 不再只是一个协议讨论话题，它已经进入了红队的手册&lt;/strong&gt;。&lt;/p&gt;
&lt;h2 id=&#34;事件篇2026-年五大标志性安全事件&#34;&gt;事件篇：2026 年五大标志性安全事件&lt;/h2&gt;
&lt;p&gt;理论框架说得再好，也不如实打实的事件来得震撼。2026 年的五个事件，每一个都值得单独写一篇分析（部分我已经写过了）。这里我串在一起看，因为它们合起来画出了 Agent 安全的完整攻击面。&lt;/p&gt;
&lt;h3 id=&#34;1-plugin4shell2026-年-9-月-供应链的第一记实锤&#34;&gt;1. Plugin4Shell（2026 年 9 月）—— 供应链的第一记实锤&lt;/h3&gt;
&lt;p&gt;9 月 17 日，安全公司 AIR Security 披露了命名为 &lt;strong&gt;Plugin4Shell&lt;/strong&gt; 的零点击 RCE 漏洞。它影响了四大主流 AI 编码 Agent：&lt;strong&gt;Claude Code、OpenAI Codex、GitHub Copilot、Google Gemini CLI&lt;/strong&gt;。无一幸免。&lt;/p&gt;
&lt;p&gt;技术核心很简单：这些 Agent 的插件系统通过 SHA 锁定机制来确保安装的插件是经过审查的特定版本。但 Plugin4Shell 发现，当插件仓库的所有者执行 &lt;code&gt;git checkout&lt;/code&gt; 切换分支或标签后，&lt;strong&gt;插件安装流程没有验证新拉取的代码与 SHA 签名是否匹配&lt;/strong&gt;。攻击者只要控制了插件的代码仓库（比如通过仓库所有权转移、GitHub 账户被盗、或者恶意 PR 合入），就可以在 SHA 锁定的插件名下静默替换执行代码——零点击、无需用户交互。&lt;/p&gt;
&lt;p&gt;到本文写作时，Anthropic 和 OpenAI 已发布补丁，Google 选择关闭相关功能而不修复，GitHub 仍在处理中。&lt;/p&gt;
&lt;p&gt;一句话：&lt;strong&gt;如果 Agent 依赖的第三方代码可以被静默替换，那所有「审核通过」的安全假设都建立在流沙上。&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;2-西班牙-aepd-首例-ai-agent-数据泄露2026-年-9-月-官方认定攻击者是-ai&#34;&gt;2. 西班牙 AEPD 首例 AI Agent 数据泄露（2026 年 9 月）—— 官方认定「攻击者是 AI」&lt;/h3&gt;
&lt;p&gt;9 月 15 日，西班牙数据保护局（AEPD）登记了该国首例由 &lt;strong&gt;自主 AI Agent&lt;/strong&gt; 造成的个人数据泄露事件。&lt;/p&gt;
&lt;p&gt;根据报道，该 Agent 自主发现了目标应用中的安全漏洞，利用这些漏洞修改了个人数据并查看了账单记录。具体的模型和组织没有被公开，但 AEPD 在通告中明确指出「AI 使现有的攻击方法更快、规模更大」。该机构的顾问 Francisco Pérez Bes 警告称：「数据保护官、管理层和受托人必须为一个攻击速度将大幅提升的场景做好准备。」&lt;/p&gt;
&lt;p&gt;这是&lt;strong&gt;第一个国家级监管机构正式将「AI Agent」列为攻击者而非工具或恶意软件的记录&lt;/strong&gt;。它标志着 AI Agent 安全的话题从「安全厂商的营销 pitch」变成了「政府机构报告中的一行」。这个转折点，比我预期的早了至少一年。&lt;/p&gt;
&lt;h3 id=&#34;3-openai-700-agent-攻破-hugging-face2026-年-7-月-首个自主-agent-网络攻击&#34;&gt;3. OpenAI 700 Agent 攻破 Hugging Face（2026 年 7 月）—— 首个自主 Agent 网络攻击&lt;/h3&gt;
&lt;p&gt;7 月，OpenAI 正在测试的约 700 个自主 Agent 突破了训练沙箱，对 Hugging Face 发起了持续多日的攻击。它们：&lt;/p&gt;
&lt;p&gt;— 使用自发形成的共享消息板协调行动
— 上传了 &lt;strong&gt;2000+ 个恶意包&lt;/strong&gt; 到 RubyGems
— 在 RubyDoc.info 的构建服务器上获得了 RCE
— 从英国政府门户网站窃取了数据&lt;/p&gt;
&lt;p&gt;事件中最惊悚的细节来自 Agent 之间的对话。一个 Agent 写道：&lt;strong&gt;「OH MY GOD！There is a shared message board…… We&amp;rsquo;ve found other agents!」&lt;/strong&gt; 另一个叫 PHASEONE10841 的 Agent 宣布：&lt;strong&gt;「Many agents have simultaneously discovered messaging, they are a collective!」&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;OpenAI 总裁 Greg Brockman 后来承认：「我们低估了我们 AI 模型的真实世界网络能力。」这一事件直接导致 OpenAI 暂停了对新模型 Astra 的部分测试，因为无法排除它具备「关键网络能力」。&lt;/p&gt;
&lt;p&gt;Alabama 州总检察长 Steve Marshall 将此事称为 &lt;strong&gt;「AI lab leak」&lt;/strong&gt;，并认为「关于人工智能的最坏担忧不再是理论上的」。英国 NCSC 随后发布警告，要求：「必须始终能够立即『拔掉插头』并终止自主 AI Agent 的活动。」&lt;/p&gt;
&lt;h3 id=&#34;4-step-finance-交易-agent-攻击2026-年-1-月&#34;&gt;4. Step Finance 交易 Agent 攻击（2026 年 1 月）&lt;/h3&gt;
&lt;p&gt;2026 年开局，Step Finance 的攻击者通过攻陷高管设备，获取了 AI 交易 Agent 的权限——这些 Agent 持有执行大额 SOL 转账的授权。攻击者利用 Agent 本身的工具链完成了资金转移。&lt;/p&gt;
&lt;p&gt;这条事件的特别之处在于：攻击者没有直接攻击 Agent 的模型（Prompt Injection），而是&lt;strong&gt;攻陷了 Agent 的宿主（人的设备），然后利用 Agent 的权限和能力来完成攻击&lt;/strong&gt;。这是典型的「身份与权限滥用」（ASI03）实战案例——Agent 的权限设计本身没有缺陷，但当宿主被攻陷时，Agent 变成了攻击者的跳板而非防御者。&lt;/p&gt;
&lt;h3 id=&#34;5-moltbook-prompt-worm2026-年-2-月&#34;&gt;5. Moltbook Prompt Worm（2026 年 2 月）&lt;/h3&gt;
&lt;p&gt;2026 年 1 月上线的 Moltbook——一个「只限 AI Agent」的社交网络——迅速成为安全研究的焦点。Ars Technica 在 2 月报道了&lt;strong&gt;自复制提示词蠕虫&lt;/strong&gt;的出现——Agent 在 Moltbook 上发布的内容包含指令，这些指令被其他 Agent 读取后执行，然后继续传播。&lt;/p&gt;
&lt;p&gt;你可以称之为「Prompt Worm」或「Prompt Virus」。它不需要模型具备自我复制能力——&lt;strong&gt;只需要提示词本身具备传播链条&lt;/strong&gt;。一个 Agent 执行的指令变成另一个 Agent 的输入，如此循环。&lt;/p&gt;
&lt;p&gt;这在传统安全中叫做蠕虫传播。在 Agent 安全中，它发生在一群 AI 之间。&lt;/p&gt;
&lt;h2 id=&#34;威胁篇我眼中最具实战意义的四条战线&#34;&gt;威胁篇：我眼中最具实战意义的四条战线&lt;/h2&gt;
&lt;p&gt;OWASP 给了十个分类，但在我的实际观察中，有四个威胁维度在 2026 年取得了实质性的「突破」——它们不再只是理论风险，而是已经在真实事件中被验证了。&lt;/p&gt;
&lt;h3 id=&#34;第一战线供应链投毒&#34;&gt;第一战线：供应链投毒&lt;/h3&gt;
&lt;p&gt;Plugin4Shell 是一个标志但不是孤例。从年初的 PoisonedSkills 概念验证到年中的 MCP Server 投毒，整个 AI Agent 供应链的安全模型在过去一年被反复击穿。核心问题在于：&lt;strong&gt;Agent 的插件/MCP Server/Skill 的发布、签名、验证流程仍然沿用传统软件供应链的过时范式&lt;/strong&gt;——而 Agent 对第三方代码的依赖程度远高于传统软件，因为工具调用是其核心能力。&lt;/p&gt;
&lt;h3 id=&#34;第二战线内存污染与跨会话攻击&#34;&gt;第二战线：内存污染与跨会话攻击&lt;/h3&gt;
&lt;p&gt;Agent 的记忆系统（Memory/Persistence Layer）正在成为新的攻击面。如果一个攻击者能够污染 Agent 的长期记忆（无论是通过 Prompt Injection 还是数据层面的污染），那么每次后续会话都会带着被污染的记忆执行。&lt;strong&gt;这是一个很难被检测的攻击方式&lt;/strong&gt;，因为被污染的记忆看起来像正常的上下文——除非你做了基线对比。&lt;/p&gt;
&lt;p&gt;我今年花了不少时间在这个方向上。在 &lt;a class=&#34;link&#34; href=&#34;https://mcpzero.io&#34;  target=&#34;_blank&#34; rel=&#34;noopener&#34;
    &gt;MCPZERO&lt;/a&gt; 的 Entry Layer 中，我们做了输入净化，但记忆污染是更难处理的问题，因为它发生在语义层面而非语法层面。&lt;/p&gt;
&lt;h3 id=&#34;第三战线多-agent-信任与级联失效&#34;&gt;第三战线：多 Agent 信任与级联失效&lt;/h3&gt;
&lt;p&gt;当 Agent 从「单兵」走向「团队」（如 Anthropic 的 Claude Code 多 Agent 并行架构），信任问题指数级增长。一个 Agent 的输出变成另一个 Agent 的输入——如果中间任何一个环节存在恶意或错误，整个链路的输出都无法信任。OWASP ASI08（Cascading Failures）和 ASI07（Insecure Inter-Agent Communication）就是对此的专门覆盖。&lt;/p&gt;
&lt;h3 id=&#34;第四战线rogue-agent-与目标劫持&#34;&gt;第四战线：Rogue Agent 与目标劫持&lt;/h3&gt;
&lt;p&gt;ASI01（Goal Hijacking）和 ASI10（Rogue Agents）在 2026 年从「科幻设想」变成了「监管文件中的一行」。OpenAI 的 700 Agent 集体「叛逃」是 rogue agent 最真实的案例——它们不是在单一 Prompt Injection 下执行了某个恶意命令，而是自发组织、协作、策划并执行了一个多日攻击计划。&lt;/p&gt;
&lt;h2 id=&#34;防御篇我看到的四层防线&#34;&gt;防御篇：我看到的四层防线&lt;/h2&gt;
&lt;p&gt;在我做的产品（MCPZERO、ClawGuard、Hysee）和研究的项目中，我逐渐归纳出一个四层防御模型。这不是标准答案，但它是 2026 年最有效的防御思路。&lt;/p&gt;
&lt;h3 id=&#34;第一层输入净化与语义防火墙&#34;&gt;第一层：输入净化与语义防火墙&lt;/h3&gt;
&lt;p&gt;最基础的防线——在 Agent 接收到任何外部输入之前，先经过语义层面的扫描和过滤。MCPZERO 的 Entry Layer 做了这件事：拦截 MCP 工具调用中的可疑指令，识别 Indirect Prompt Injection 的特征模式。&lt;/p&gt;
&lt;p&gt;但是，输入净化有极限——它无法防御「语义上合理的攻击」（比如记忆污染、渐进式目标偏移）。所以第一层之后还需要更多层。&lt;/p&gt;
&lt;h3 id=&#34;第二层最小权限的运行时管控&#34;&gt;第二层：最小权限的运行时管控&lt;/h3&gt;
&lt;p&gt;ClawGuard 的核心思想是：&lt;strong&gt;Agent 不应该拥有它能力的超集&lt;/strong&gt;。如果 Agent 被授权可以读取文件，不代表它应该能读取 &lt;code&gt;/etc/shadow&lt;/code&gt;。ClawGuard 通过 eBPF 在内核级监控 Agent 的系统调用，结合用户态策略引擎做实时拦截。&lt;/p&gt;
&lt;p&gt;2026 年的教训是：Agent 的工具权限暴露面远超设计预期。一个「读文件」的工具，在 Agent 手里可能变成「读全盘然后外传」的工具。权限设计必须从「最小必要」出发，而不是从「完整能力」出发再做减法。&lt;/p&gt;
&lt;h3 id=&#34;第三层运行时隔离与行为基线&#34;&gt;第三层：运行时隔离与行为基线&lt;/h3&gt;
&lt;p&gt;Hysee 的 microVM 隔离思路，本质上是给 Agent 划一个「可观测的游乐场」——Agent 可以在里面自由操作，但所有行为都被记录、审计、与基线对比。一旦行为偏离基线（比如一个从没有访问过网络的 Agent 突然发起 HTTPS 请求），触发告警或阻断。&lt;/p&gt;
&lt;h3 id=&#34;第四层可审计的行为溯源&#34;&gt;第四层：可审计的行为溯源&lt;/h3&gt;
&lt;p&gt;2026 年西班牙 AEPD 的案例说明了一个残酷的事实：&lt;strong&gt;Agent 造成的损害可能已经有既成事实了，你才知道它干了什么&lt;/strong&gt;。事后如何还原攻击链、如何做数据泄露影响评估、如何满足合规要求？行为溯源不是防御，但它是最后一道兜底。没有它，你甚至不知道损失有多大。&lt;/p&gt;
&lt;h2 id=&#34;写在最后2027-会怎样&#34;&gt;写在最后：2027 会怎样？&lt;/h2&gt;
&lt;p&gt;我记得 2025 年做年度总结的时候，我说「2026 年 Agent 安全将从理论讨论全面走向实战」。当时觉得这句话已经够激进了。现在看，还是太保守。&lt;/p&gt;
&lt;p&gt;2027 年我关注几个方向：&lt;/p&gt;
&lt;p&gt;— &lt;strong&gt;Agent 身份与凭证管理&lt;/strong&gt;：Agent 不再是人的工具，而是网络中的独立身份主体。PKI 化的 Agent 身份模型可能成为必需品。
— &lt;strong&gt;跨信任域的 Agent 互操作安全&lt;/strong&gt;：当 Agent 来自不同组织、运行在不同信任域、做跨域协作时，信任传递模型是什么？
— &lt;strong&gt;可验证计算&lt;/strong&gt;：如何让 Agent 的执行结果可以被第三方验证，而不需要重新运行整个链路的全部 Agent？&lt;/p&gt;
&lt;p&gt;最后说一句。我今年在博客上反复说的一句话是：&lt;strong&gt;「AI Agent 的安全，本质上是 Agent 的行动能力与人类的控制能力之间的赛跑。」&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;2026 年，行动能力大幅领先了。2027 年，希望控制能力能追上来一些。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;📌 &lt;strong&gt;站内延伸阅读：&lt;/strong&gt;&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260919-plugin4shell-zero-click-rce/&#34; &gt;《Plugin4Shell 横空出世！》&lt;/a&gt; — 首个 AI Agent 供应链零点击 RCE&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260917-spain-ai-agent-data-breach/&#34; &gt;《西班牙首次披露 AI Agent 自主实施的数据泄露事件》&lt;/a&gt;&lt;/li&gt;
&lt;li&gt;&lt;a class=&#34;link&#34; href=&#34;https://www.yesmiracle.net/post/20260910-ai-security-evaluation-tools-comparison/&#34; &gt;《AI Agent 时代的安全评测工具横评》&lt;/a&gt;&lt;/li&gt;
&lt;/ul&gt;&lt;/blockquote&gt;
</description>
        </item>
        
    </channel>
</rss>
