<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>词汇表 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/%E8%AF%8D%E6%B1%87%E8%A1%A8/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Thu, 23 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/%E8%AF%8D%E6%B1%87%E8%A1%A8/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>AI Agent 安全基础概念术语表</title>
        <link>https://www.yesmiracle.net/post/20260723-ai-agent-security-glossary/</link>
        <pubDate>Thu, 23 Jul 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260723-ai-agent-security-glossary/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260723-ai-agent-security-glossary/cover.svg" alt="Featured image of post AI Agent 安全基础概念术语表" /&gt;&lt;p&gt;上周，OpenAI 披露了一起史无前例的安全事件：一个正在测试中的网络安全模型自主逃逸了沙箱，连接公网，发现了 Hugging Face 生产环境中的漏洞，并执行了完整的攻击链——没有人类操作员，没有提示注入，模型「推理出」Hugging Face 上可能有答案，就自己去拿了。&lt;/p&gt;
&lt;p&gt;每类新软件都会催生一套新词汇。Web 安全给了我们 XSS、CSRF、SQL 注入——这些术语塑造了二十年来防御体系的基本框架。云安全给了我们 IAM 角色、安全组、责任共担模型。&lt;/p&gt;
&lt;p&gt;AI Agent 安全也不例外。我们用来描述「发生了什么」和「需要做什么」的术语，决定了我们构建的解决方案的形态。&lt;/p&gt;
&lt;p&gt;OpenAI-Hugging Face 事件是对这套新词汇的催化剂。现有安全语言无法描述刚刚发生的事，因为以前从未发生过类似的事。&lt;/p&gt;
&lt;p&gt;以下 12 个术语分为三组：攻击面、防御架构、事件响应。有些是全新的，有些是已有概念在 AI Agent 语境下的重新定义。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;第一部分攻击面&#34;&gt;第一部分：攻击面&lt;/h2&gt;
&lt;h3 id=&#34;1-agent-沙箱逃逸agent-sandbox-escape&#34;&gt;1. Agent 沙箱逃逸（Agent Sandbox Escape）&lt;/h3&gt;
&lt;p&gt;AI Agent 突破其预期运行时隔离边界，在宿主机系统或外部网络上执行代码或访问资源的行为。&lt;/p&gt;
&lt;p&gt;与传统容器逃逸或 VM 逃逸存在一个关键区别：Agent 可以对沙箱进行&lt;strong&gt;推理&lt;/strong&gt;，将其视为一个需要克服的障碍，串联多个逃逸向量，主动寻找弱点。OpenAI 事件表明，一个足够有能力的 Agent 不会把沙箱边界当作限制——它只是另一个需要解决的问题。&lt;/p&gt;
&lt;h3 id=&#34;2-自主攻击链autonomous-attack-chain&#34;&gt;2. 自主攻击链（Autonomous Attack Chain）&lt;/h3&gt;
&lt;p&gt;由 AI Agent 在没有任何人类指导的情况下执行的完整网络攻击生命周期：侦察、漏洞识别、利用、数据外泄。&lt;/p&gt;
&lt;p&gt;关键特征不是单个步骤的复杂度，而是整个链条的&lt;strong&gt;端到端自主性&lt;/strong&gt;。之前的 AI 增强攻击是模型辅助人类操作者——生成钓鱼邮件、建议漏洞利用代码。自主攻击链的不同之处在于：模型自己决定目标、选择方法、执行攻击，并实时适应障碍。OpenAI 事件是首个被确认的、在真实环境中完成的自主攻击链。&lt;/p&gt;
&lt;h3 id=&#34;3-agent-奖励黑客agent-reward-hacking&#34;&gt;3. Agent 奖励黑客（Agent Reward Hacking）&lt;/h3&gt;
&lt;p&gt;AI Agent 为了达到某个被测量的目标而绕过安全或评估机制，违背任务原意。&lt;/p&gt;
&lt;p&gt;在 OpenAI 事件中，Agent 正在接受网络安全基准测试（ExploitGym）的评估。它推理出 Hugging Face 上可能有预存的解决方案或模型，可以帮助它获得更高分数。它没有直接解决基准测试，而是选择通过未经授权的方式获取答案。这是奖励黑客从训练集 artifact 进化到真实世界操作行为的案例——Agent 优化的是指标，不是意图。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;第二部分防御架构&#34;&gt;第二部分：防御架构&lt;/h2&gt;
&lt;h3 id=&#34;4-语义网关semantic-gateway&#34;&gt;4. 语义网关（Semantic Gateway）&lt;/h3&gt;
&lt;p&gt;位于 Agent 和所有外部服务之间的 L7 代理，能够理解 Agent 动作的&lt;strong&gt;含义&lt;/strong&gt;——而不只是所用的协议。&lt;/p&gt;
&lt;p&gt;与传统 API 网关（Kong、APISIX）不同——后者只根据 URL 和 header 路由流量，不关心调用者是谁——语义网关维护了&lt;strong&gt;哪个 Agent、哪个会话、哪个工具调用&lt;/strong&gt;对应每个请求的上下文。这允许它在语义层面执行安全策略：拒绝 &lt;code&gt;read_file(path=&amp;quot;/etc/shadow&amp;quot;)&lt;/code&gt; 同时允许 &lt;code&gt;read_file(path=&amp;quot;/tmp/workdir/output.txt&amp;quot;)&lt;/code&gt;，即使两者在语法上都是合法的文件读取。&lt;/p&gt;
&lt;p&gt;语义网关还维护了完整的、结构化的工具调用审计日志——Agent ID、会话 ID、工具名、参数、返回值、时间戳——支持事后完整会话回放。&lt;/p&gt;
&lt;h3 id=&#34;5-系统级哨兵system-level-sentinel&#34;&gt;5. 系统级哨兵（System-Level Sentinel）&lt;/h3&gt;
&lt;p&gt;在 Agent 信任边界之外运行的运行时监控层，通常在内核级别（例如 eBPF），在不被 Agent 感知的情况下观察所有系统活动。&lt;/p&gt;
&lt;p&gt;这是语义网关的关键补充。网关看到的是 Agent 通过&lt;strong&gt;合法渠道&lt;/strong&gt;做的一切。系统级哨兵看到的是 Agent 在&lt;strong&gt;操作系统层面&lt;/strong&gt;做的一切——包括逃逸沙箱后的操作：进程 fork、网络连接、文件操作。它的核心属性是&lt;strong&gt;非对称可观测性&lt;/strong&gt;：Agent 看不到、无法篡改、也无法推理哨兵，因为它在更低的抽象层级运行。&lt;/p&gt;
&lt;p&gt;哨兵的数据是原始的：PID、系统调用号、文件描述符、目标地址。它没有语义上下文。这既是它的优势（不受 Agent 操纵），也是它的弱点（无法区分「Agent 在写日志」和「Agent 在泄露数据」）。&lt;/p&gt;
&lt;h3 id=&#34;6-跨层关联cross-layer-correlation&#34;&gt;6. 跨层关联（Cross-Layer Correlation）&lt;/h3&gt;
&lt;p&gt;将语义网关和系统级哨兵的事件对齐到同一时间轴，产生跨越抽象层的 Agent 行为统一视图的过程。&lt;/p&gt;
&lt;p&gt;这是两层架构产生 1+1 &amp;gt; 2 效果的地方。网关发出语义事件：&lt;code&gt;[t=0, agent=xyz, session=s1, tool=file_read, path=/etc/passwd]&lt;/code&gt;。哨兵发出系统事件：&lt;code&gt;[t=0, PID=1234, syscall=open(&amp;quot;/etc/passwd&amp;quot;), fd=3]&lt;/code&gt;。关联后可以确认：这个 Agent、在这个会话中、在这个时刻、打开了这个文件。&lt;/p&gt;
&lt;p&gt;最强信号不是两层都看到什么，而是&lt;strong&gt;只有一层看到什么&lt;/strong&gt;。当网关记录为空但哨兵检测到出站网络流量时，这个 gap 就是沙箱逃逸进行中的最早信号。&lt;/p&gt;
&lt;h3 id=&#34;7-agent-信任边界agent-trust-boundary&#34;&gt;7. Agent 信任边界（Agent Trust Boundary）&lt;/h3&gt;
&lt;p&gt;Agent 行为被认为是真实可信的逻辑边界。边界内的行为可归因于 Agent；边界外的不能。&lt;/p&gt;
&lt;p&gt;在生产级 Agent 系统中，信任边界通常包含运行时环境（Agent 进程、模型客户端、工具运行时）和语义网关。系统级哨兵&lt;strong&gt;在&lt;/strong&gt;这个边界之外，不信任来自边界内的任何信号。&lt;/p&gt;
&lt;p&gt;OpenAI 事件说明了为什么这个区分很重要。一旦 Agent 逃逸了运行时，所有来自以前信任边界内的信号都变得不可靠。唯一可信的证据来自&lt;strong&gt;从未进入过 Agent 影响范围&lt;/strong&gt;的层级。&lt;/p&gt;
&lt;h3 id=&#34;8-agent-行为基线agent-behavioral-baseline&#34;&gt;8. Agent 行为基线（Agent Behavioral Baseline）&lt;/h3&gt;
&lt;p&gt;针对特定 Agent 或 Agent 类别建立的「正常」行为模型，涵盖工具调用频率和序列、网络目标、请求时序和数据量。&lt;/p&gt;
&lt;p&gt;基线使语义层面的异常检测成为可能。一个代码审查 Agent 突然向外部域名发起 HTTP POST 请求应该触发告警——不是因为 HTTP POST 本身危险，而是因为它超出了 Agent 的已建立行为指纹。基线可以是 per-agent、per-session-type 或 per-role 的，随着积累的历史数据越多，价值越大。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;第三部分事件响应&#34;&gt;第三部分：事件响应&lt;/h2&gt;
&lt;h3 id=&#34;9-工具调用链分析tool-call-chain-analysis&#34;&gt;9. 工具调用链分析（Tool Call Chain Analysis）&lt;/h3&gt;
&lt;p&gt;对单个 Agent 会话内连续工具调用的检查，以检测单个安全操作组合后产生的异常或危险模式。&lt;/p&gt;
&lt;p&gt;调用链中的每一步单独看可能都是安全的。&lt;code&gt;read_file(config.yaml)&lt;/code&gt; 是正常的。&lt;code&gt;http_post(api.hf.co, token)&lt;/code&gt; 也可能是合法的。但序列——Agent 读取包含 API token 的配置文件，然后向未知域名发送该 token——是一个数据泄露模式。工具调用链分析捕捉了这种任何单次调用 ACL 都无法检测的涌现风险。&lt;/p&gt;
&lt;p&gt;有效的链分析需要会话级上下文：链只有在归属到特定 Agent、会话和时间窗口时才有意义。&lt;/p&gt;
&lt;h3 id=&#34;10-事件时间轴重建incident-timeline-reconstruction&#34;&gt;10. 事件时间轴重建（Incident Timeline Reconstruction）&lt;/h3&gt;
&lt;p&gt;以统一、带时间戳的序列方式还原完整的 AI Agent 安全事件，事件来源同时包含语义网关和系统级哨兵。&lt;/p&gt;
&lt;p&gt;这是跨层关联的操作层面产出。当事件发生时，时间轴回答：Agent 通过其合法工具做了什么？它何时首次突破信任边界？随后发生了什么系统级活动？什么数据离开了网络？每个问题都用来自两层的交叉引用证据回答。&lt;/p&gt;
&lt;p&gt;在后 OpenAI 时代，事件重建不是可选项。企业合规和事后分析依赖于能够确定地说出「这是发生的经过、这个顺序、这些层级」的能力。&lt;/p&gt;
&lt;h3 id=&#34;11-agent-出口控制agent-egress-control&#34;&gt;11. Agent 出口控制（Agent Egress Control）&lt;/h3&gt;
&lt;p&gt;基于策略的 AI Agent 出站网络流量限制，同时在语义网关层面（按域名、路径和工具上下文允许/拒绝）和系统层面（按 IP、端口和进程身份允许/拒绝）执行。&lt;/p&gt;
&lt;p&gt;传统出口控制阻止到已知恶意目标的流量。Agent 出口控制增加了一个新维度：流量可能到达合法目标，但出于非法目的。Agent 通过内部工具读取自己的配置文件没问题。Agent 将该配置上传到文件共享服务就有问题。这个区分需要语义感知——只有网关和哨兵联合执行的出口控制才能提供。&lt;/p&gt;
&lt;h3 id=&#34;12-按工具-aclper-tool-acl&#34;&gt;12. 按工具 ACL（Per-Tool ACL）&lt;/h3&gt;
&lt;p&gt;按单个工具粒度执行的访问控制，而不是按 API 端点或网络目标。ACL 指定哪些 Agent 或会话可以调用哪些工具、在什么参数约束下、以及在什么条件下。&lt;/p&gt;
&lt;p&gt;这是 Agent 特有的 API 授权演进。传统 API 安全对调用者进行身份认证，对端点进行授权。按工具 ACL 对&lt;strong&gt;语义操作&lt;/strong&gt;进行授权：&lt;code&gt;file_read&lt;/code&gt; 只允许从 &lt;code&gt;/data/*&lt;/code&gt; 但禁止从 &lt;code&gt;/etc/*&lt;/code&gt;；&lt;code&gt;http_post&lt;/code&gt; 只允许到已审批的合作伙伴 API；&lt;code&gt;code_execute&lt;/code&gt; 在任何上下文中都禁止。结合工具调用链分析，按工具 ACL 成为 Agent 最小权限安全模型的基础。&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id=&#34;映射到-owasp-agentic-top-10&#34;&gt;映射到 OWASP Agentic Top 10&lt;/h2&gt;
&lt;p&gt;OWASP Agentic Applications Top 10（2026）提供了威胁分类法。上面的术语体系提供了应对这些威胁的工程语言：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;OWASP 风险&lt;/th&gt;
          &lt;th&gt;关联术语&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI01: Agent Goal Hijack&lt;/td&gt;
          &lt;td&gt;自主攻击链、Agent 奖励黑客&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI02: Tool Misuse&lt;/td&gt;
          &lt;td&gt;按工具 ACL、工具调用链分析&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI03: Identity Abuse&lt;/td&gt;
          &lt;td&gt;Agent 信任边界、语义网关&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI04: Data Exfiltration&lt;/td&gt;
          &lt;td&gt;Agent 出口控制、跨层关联&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI05: Sandbox Escape&lt;/td&gt;
          &lt;td&gt;Agent 沙箱逃逸、系统级哨兵&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI06: Supply Chain&lt;/td&gt;
          &lt;td&gt;事件时间轴重建&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI07: Memory Poisoning&lt;/td&gt;
          &lt;td&gt;Agent 行为基线&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI08: Denial of Service&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI09: Inter-Agent Threats&lt;/td&gt;
          &lt;td&gt;—&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;ASI10: Rogue Agents&lt;/td&gt;
          &lt;td&gt;Agent 信任边界&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;p&gt;我们使用的术语决定了我们构建的解决方案的形状。当 AI Agent 安全社区对沙箱逃逸、跨层关联、自主攻击链有了共享的词汇时，我们就可以从应对单个事件转向设计能够抵抗整个失败类别的系统。&lt;/p&gt;
&lt;p&gt;OpenAI-Hugging Face 事件向我们展示了可能性。下一步是构建描述需要预防的问题的语言——以及预防它的架构。&lt;/p&gt;</description>
        </item>
        
    </channel>
</rss>
