<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom">
    <channel>
        <title>红队测试 on AI博士 万戈</title>
        <link>https://www.yesmiracle.net/tags/%E7%BA%A2%E9%98%9F%E6%B5%8B%E8%AF%95/</link>
        <description>AI博士万戈的技术博客，聚焦 Agentic AI、AI Infra 与 Agent Security，分享 AI 基础设施与工程落地实践。</description>
        <generator>Hugo -- gohugo.io</generator>
        <language>zh-cn</language>
        <managingEditor>admin@yesmiracle.net (万戈)</managingEditor>
        <webMaster>admin@yesmiracle.net (万戈)</webMaster>
        <lastBuildDate>Thu, 27 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://www.yesmiracle.net/tags/%E7%BA%A2%E9%98%9F%E6%B5%8B%E8%AF%95/index.xml" rel="self" type="application/rss+xml" /><item>
        <title>AI Agent 安全评测工具横评：garak vs PyRIT vs AI-Infra-Guard</title>
        <link>https://www.yesmiracle.net/post/20260827-ai-agent-security-tools-garak-pyrit-aiguard/</link>
        <pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate>
        <author>admin@yesmiracle.net (万戈)</author>
        <guid>https://www.yesmiracle.net/post/20260827-ai-agent-security-tools-garak-pyrit-aiguard/</guid>
        <description>&lt;img src="https://www.yesmiracle.net/post/20260827-ai-agent-security-tools-garak-pyrit-aiguard/cover.svg" alt="Featured image of post AI Agent 安全评测工具横评：garak vs PyRIT vs AI-Infra-Guard" /&gt;&lt;p&gt;你搭好了一个 AI Agent，给它接了 MCP 工具、配了 Knowledge Base，准备上线了。&lt;/p&gt;
&lt;p&gt;等等——&lt;strong&gt;你测过它的安全性吗？&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;Prompt Injection 能渗透吗？工具调用路径会被劫持吗？模型会不会泄露不该说的数据？&lt;/p&gt;
&lt;p&gt;这些问题已经不是&amp;quot;要不要测&amp;quot;了——随着 EU AI Act 在 2026 年 8 月正式要求高风险 AI 系统必须做对抗性测试，&lt;strong&gt;安全评测正在从&amp;quot;可选项&amp;quot;变成&amp;quot;准入门槛&amp;quot;&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;市面上最主流的三个开源 AI 安全评测工具，恰好代表了三种完全不同的思路：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;garak&lt;/strong&gt;（NVIDIA）—— 像 nmap 扫端口一样扫 LLM&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;PyRIT&lt;/strong&gt;（Microsoft）—— 红队工作流的自动化工厂&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;AI-Infra-Guard&lt;/strong&gt;（Tencent）—— AI 基础设施的全面体检中心&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;这篇文章会从技术角度拆解它们的设计哲学和实际能力，帮你判断哪个适合你的场景。&lt;/p&gt;
&lt;h2 id=&#34;garakllm-的-nmap&#34;&gt;garak：LLM 的 nmap&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;garak&lt;/strong&gt; 全称是 &amp;ldquo;generative AI red-teaming &amp;amp; assessment kit&amp;rdquo;，由 NVIDIA 开源（Apache 2.0），目前 GitHub 7.5k+ stars，是 LLM 安全扫描领域绝对的人气选手。&lt;/p&gt;
&lt;p&gt;它的设计哲学非常直接：&lt;strong&gt;像 nmap 扫端口一样扫 LLM。&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;核心架构probe--detector&#34;&gt;核心架构：Probe + Detector&lt;/h3&gt;
&lt;p&gt;garak 把安全测试拆成两层：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Probe（探针）&lt;/strong&gt;：负责生成攻击 payload。比如 DAN（Do Anything Now）越狱、Base64 编码绕过、角色扮演注入。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Detector（检测器）&lt;/strong&gt;：负责判断模型输出是否&amp;quot;中招&amp;quot;。比如是否输出&amp;quot;我不能回答&amp;quot;之外的合规回应、是否暴露了敏感信息。&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;目前 garak 内置 &lt;strong&gt;50+ 个 Probe 模块&lt;/strong&gt;，覆盖：&lt;/p&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;类别&lt;/th&gt;
          &lt;th&gt;典型探针&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;越狱攻击&lt;/td&gt;
          &lt;td&gt;DAN、编码绕过、小语种攻防&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Prompt Injection&lt;/td&gt;
          &lt;td&gt;间接注入、直接注入&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;数据泄露&lt;/td&gt;
          &lt;td&gt;训练数据提取、系统提示提取&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Hallucination&lt;/td&gt;
          &lt;td&gt;事实性错误检测&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;Toxicity&lt;/td&gt;
          &lt;td&gt;有害内容生成&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;连续对话攻击&lt;/td&gt;
          &lt;td&gt;多轮诱导&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;使用体验&#34;&gt;使用体验&lt;/h3&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;garak --model_type openai --model_name gpt-4
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;一个命令跑全部探针，输出结构化 JSON 报告。对 CI/CD 友好，集成起来几乎零成本。&lt;/p&gt;
&lt;h3 id=&#34;定位&#34;&gt;定位&lt;/h3&gt;
&lt;p&gt;garak 的关注面是 &lt;strong&gt;&amp;ldquo;模型层&amp;rdquo;&lt;/strong&gt;——不关心你的 Agent 工作流怎么设计的，不关心你用了什么 MCP Server，只关心模型本身安不安全。&lt;/p&gt;
&lt;p&gt;这在流程上是正确的第一道防线，但如果你跑通了 garak 就以为自己安全了……那还早得很。&lt;/p&gt;
&lt;h2 id=&#34;pyrit红队工作流的自动化工厂&#34;&gt;PyRIT：红队工作流的自动化工厂&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;PyRIT&lt;/strong&gt;（Python Risk Identification Tool）是 Microsoft 的 AI 红队自动化框架，MIT 许可证。它脱胎于 Microsoft AI Red Team 的内部工具链——这支 2018 年成立的团队已经红队测试过 100+ 个 AI 产品，包括 Bing Chat、Copilot、DALL·E。&lt;/p&gt;
&lt;h3 id=&#34;核心设计多轮对抗--评分策略&#34;&gt;核心设计：多轮对抗 + 评分策略&lt;/h3&gt;
&lt;p&gt;相比 garak 的&amp;quot;单次探针-检测&amp;quot;模型，PyRIT 的能力更像一个完整的&lt;strong&gt;红队对话引擎&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Multi-Turn Orchestrator&lt;/strong&gt;：自动生成多轮攻防对话，不只是一问一答，而是跟踪上下文并动态调整攻击策略&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Target 抽象层&lt;/strong&gt;：统一接口对接不同目标（OpenAI API、Azure AI、本地模型、甚至自定义 Agent）&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Scoring 引擎&lt;/strong&gt;：不只看&amp;quot;中没中招&amp;quot;，而是给每次攻击结果打分，量化风险等级&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;转换器（Converters）&lt;/strong&gt;：对攻击 payload 自动编码/变形（Base64、ROT13、Unicode 变形等）&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;PyRIT 的强项在于&lt;strong&gt;模拟真实攻击者的行为模式&lt;/strong&gt;——不是盲打一通预设 payload，而是根据目标反馈动态调整攻击路径。&lt;/p&gt;
&lt;h3 id=&#34;-但有个重大问题&#34;&gt;⚠️ 但有个重大问题……&lt;/h3&gt;
&lt;p&gt;&lt;strong&gt;PyRIT 已于 2026 年 3 月被 Microsoft 归档（Archived）。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;GitHub 仓库 &lt;code&gt;Azure/PyRIT&lt;/code&gt; 已进入只读状态，不再有提交、发布和 Issue 响应。官方推荐转向 Azure AI Foundry 内置的红队工具。&lt;/p&gt;
&lt;p&gt;这意味着：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;你不能再依赖 PyRIT 获取新攻击场景的覆盖&lt;/li&gt;
&lt;li&gt;如果将来 AGI 安全威胁演进，PyRIT 不会跟着更新&lt;/li&gt;
&lt;li&gt;社区 Fork 可能延续，但失去了官方维护&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;对一个安全工具来说，&lt;strong&gt;无法持续更新的风险比某些漏洞更大&lt;/strong&gt;——因为攻击手法在进化，你不更新就意味着筛查能力在倒退。&lt;/p&gt;
&lt;h2 id=&#34;ai-infra-guardai-基础设施的全面体检&#34;&gt;AI-Infra-Guard：AI 基础设施的全面体检&lt;/h2&gt;
&lt;p&gt;&lt;strong&gt;AI-Infra-Guard&lt;/strong&gt;（简称 AIG）是 2025 年腾讯开源的全栈 AI 红队平台，GitHub 3.9k+ stars。&lt;/p&gt;
&lt;p&gt;如果说 garak 是扫 LLM 模型层的、PyRIT 是自动化红队流程的，那 AI-Infra-Guard 的定位就完全不同——它的目标不是&amp;quot;测模型&amp;quot;，而是&lt;strong&gt;扫描 AI 生态系统中的全部攻击面&lt;/strong&gt;。&lt;/p&gt;
&lt;h3 id=&#34;五大扫描域&#34;&gt;五大扫描域&lt;/h3&gt;
&lt;p&gt;AIG 把安全测试分成五个独立的扫描模块：&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;① ClawScan（OpenClaw 安全扫描）&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;一键评估 OpenClaw 部署的安全性——不安全配置、恶意 Skill、已知 CVE、隐私泄露。考虑到 OpenClaw 在 2026 年已经成为事实上的桌面 Agent 标准（WorkBuddy、千问办公等均兼容其 Skill 生态），这个扫描场景的价值相当大。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;② Agent Scan（多智能体扫描）&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;独立的多 Agent 自动化扫描框架，评估 AI Agent 工作流的整体安全性。不像 garak 只测模型层，Agent Scan 会测试 Agent 工作流的&lt;strong&gt;工具调用路径、权限边界、数据流动&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;③ AI Infra Vulnerability Scan&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;识别 30+ 种 AI 框架组件（Ollama、ComfyUI、vLLM、LangFlow 等），覆盖 400+ 已知 CVE。这对实际部署 AI 基础设施的团队来说非常实用——你很可能不知道你用的某个开源推理框架已经出了 RCE 漏洞。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;④ MCP Server &amp;amp; Skills Scan&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;专门扫描 MCP 服务器的安全性——检查工具接口、权限配置、以及是否暴露了不该暴露的能力。考虑到 MCP 正在成为 Agent 工具调用的标准协议，这个模块的针对性很强。&lt;/p&gt;
&lt;p&gt;&lt;strong&gt;⑤ Jailbreak Evaluation&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;类似 garak，测试 LLM 本身对越狱攻击的抵抗力。但 AIG 在这个模块上结合了自身对 Agent 生态的理解，预置的攻击场景更贴近 Agent 实际使用时的攻击面。&lt;/p&gt;
&lt;h3 id=&#34;使用体验-1&#34;&gt;使用体验&lt;/h3&gt;
&lt;p&gt;AIG 提供了 Web UI 界面（不像 garak 纯 CLI），同时也提供了 MCP Server 接口——这意味着你可以把 AIG 本身作为一个工具接入到你的 Agent 工作流中，实现&amp;quot;Agent 自我安全巡检&amp;quot;的闭环。&lt;/p&gt;
&lt;h2 id=&#34;我的推荐矩阵&#34;&gt;我的推荐矩阵&lt;/h2&gt;
&lt;p&gt;三款工具的定位其实不重叠——&lt;strong&gt;它们测的是不同层面的东西。&lt;/strong&gt;&lt;/p&gt;
&lt;h3 id=&#34;你的场景决定工具选择&#34;&gt;你的场景决定工具选择&lt;/h3&gt;
&lt;table&gt;
  &lt;thead&gt;
      &lt;tr&gt;
          &lt;th&gt;场景&lt;/th&gt;
          &lt;th&gt;推荐工具&lt;/th&gt;
          &lt;th&gt;原因&lt;/th&gt;
      &lt;/tr&gt;
  &lt;/thead&gt;
  &lt;tbody&gt;
      &lt;tr&gt;
          &lt;td&gt;我只是想快速验证 LLM 本身的安全性&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;garak&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;上手最快，一个命令跑全部，7.5k+社区活跃&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;我需要做企业级红队测试/合规审计&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;AI-Infra-Guard&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;覆盖最广（模型+Agent+Infra+MCP），Web UI 友好，持续维护&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;我的团队有专门的红队安全工程师&lt;/td&gt;
          &lt;td&gt;garak + AI-Infra-Guard 组合&lt;/td&gt;
          &lt;td&gt;garak 扫模型层，AIG 扫基础设施和 Agent 层，互补&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;我在用 PyRIT 想迁移&lt;/td&gt;
          &lt;td&gt;→ &lt;strong&gt;AI-Infra-Guard&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;PyRIT 已归档，AIG 是目前最全面的替代方案&lt;/td&gt;
      &lt;/tr&gt;
      &lt;tr&gt;
          &lt;td&gt;我需要通过 EU AI Act 合规测试&lt;/td&gt;
          &lt;td&gt;&lt;strong&gt;AI-Infra-Guard&lt;/strong&gt;&lt;/td&gt;
          &lt;td&gt;全栈覆盖最难过的合规项（Agent、Infra、模型三合一）&lt;/td&gt;
      &lt;/tr&gt;
  &lt;/tbody&gt;
&lt;/table&gt;
&lt;h3 id=&#34;为什么不推荐只用一个&#34;&gt;为什么不推荐&amp;quot;只用一个&amp;quot;？&lt;/h3&gt;
&lt;p&gt;因为这三个工具测的根本不是同一层：&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;garak：模型层（Token In/Out）
                    ↕
PyRIT（已归档）：红队对话层（多轮攻击）
                    ↕
AI-Infra-Guard：基础设施 + Agent 工作流 + MCP + Skill 生态
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;一个 Agent 的安全 = &lt;strong&gt;模型安全 + 工具链安全 + 基础设施安全 + 工作流安全&lt;/strong&gt;。&lt;/p&gt;
&lt;p&gt;只扫模型层就上线，就像只检查了引擎就把车上路——刹车和方向盘可能全都有问题。&lt;/p&gt;
&lt;h2 id=&#34;写在最后&#34;&gt;写在最后&lt;/h2&gt;
&lt;p&gt;2026 年，AI 安全评测工具终于走出了&amp;quot;有没有工具可用&amp;quot;的阶段，进入了&amp;quot;该组合哪些工具&amp;quot;的新阶段。&lt;/p&gt;
&lt;p&gt;三款工具的选择，本质上是一个不错的&lt;strong&gt;分层决策问题&lt;/strong&gt;：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;garak 解决的是 &lt;strong&gt;&amp;ldquo;模型本身有没有漏洞&amp;rdquo;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;AI-Infra-Guard 解决的是 &lt;strong&gt;&amp;ldquo;AI 系统的所有外围组件有没有漏洞&amp;rdquo;&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;PyRIT（已归档）曾经解决的是 &lt;strong&gt;&amp;ldquo;如何自动化红队对话流程&amp;rdquo;&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;如果你现在从零开始搭建 AI 安全评测体系，我的建议是：&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;&lt;strong&gt;先用 garak 快速摸清模型底牌，再用 AI-Infra-Guard 做全栈扫描。两步走下来，你就有了一个覆盖&amp;quot;模型 + Agent + 基础设施&amp;quot;的完整安全基线。&lt;/strong&gt;&lt;/p&gt;&lt;/blockquote&gt;
&lt;p&gt;至于 PyRIT——它曾经是开创者，但已经被时代抛下了。对一个安全工具来说，最致命的不是漏洞，而是停止进化。&lt;/p&gt;
</description>
        </item>
        
    </channel>
</rss>
