Featured image of post AI Agent 安全评测工具横评:garak vs PyRIT vs AI-Infra-Guard

AI Agent 安全评测工具横评:garak vs PyRIT vs AI-Infra-Guard

你搭好了一个 AI Agent,给它接了 MCP 工具、配了 Knowledge Base,准备上线了。

等等——你测过它的安全性吗?

Prompt Injection 能渗透吗?工具调用路径会被劫持吗?模型会不会泄露不该说的数据?

这些问题已经不是"要不要测"了——随着 EU AI Act 在 2026 年 8 月正式要求高风险 AI 系统必须做对抗性测试,安全评测正在从"可选项"变成"准入门槛"

市面上最主流的三个开源 AI 安全评测工具,恰好代表了三种完全不同的思路:

  • garak(NVIDIA)—— 像 nmap 扫端口一样扫 LLM
  • PyRIT(Microsoft)—— 红队工作流的自动化工厂
  • AI-Infra-Guard(Tencent)—— AI 基础设施的全面体检中心

这篇文章会从技术角度拆解它们的设计哲学和实际能力,帮你判断哪个适合你的场景。

garak:LLM 的 nmap

garak 全称是 “generative AI red-teaming & assessment kit”,由 NVIDIA 开源(Apache 2.0),目前 GitHub 7.5k+ stars,是 LLM 安全扫描领域绝对的人气选手。

它的设计哲学非常直接:像 nmap 扫端口一样扫 LLM。

核心架构:Probe + Detector

garak 把安全测试拆成两层:

  • Probe(探针):负责生成攻击 payload。比如 DAN(Do Anything Now)越狱、Base64 编码绕过、角色扮演注入。
  • Detector(检测器):负责判断模型输出是否"中招"。比如是否输出"我不能回答"之外的合规回应、是否暴露了敏感信息。

目前 garak 内置 50+ 个 Probe 模块,覆盖:

类别 典型探针
越狱攻击 DAN、编码绕过、小语种攻防
Prompt Injection 间接注入、直接注入
数据泄露 训练数据提取、系统提示提取
Hallucination 事实性错误检测
Toxicity 有害内容生成
连续对话攻击 多轮诱导

使用体验

garak --model_type openai --model_name gpt-4

一个命令跑全部探针,输出结构化 JSON 报告。对 CI/CD 友好,集成起来几乎零成本。

定位

garak 的关注面是 “模型层”——不关心你的 Agent 工作流怎么设计的,不关心你用了什么 MCP Server,只关心模型本身安不安全。

这在流程上是正确的第一道防线,但如果你跑通了 garak 就以为自己安全了……那还早得很。

PyRIT:红队工作流的自动化工厂

PyRIT(Python Risk Identification Tool)是 Microsoft 的 AI 红队自动化框架,MIT 许可证。它脱胎于 Microsoft AI Red Team 的内部工具链——这支 2018 年成立的团队已经红队测试过 100+ 个 AI 产品,包括 Bing Chat、Copilot、DALL·E。

核心设计:多轮对抗 + 评分策略

相比 garak 的"单次探针-检测"模型,PyRIT 的能力更像一个完整的红队对话引擎

  • Multi-Turn Orchestrator:自动生成多轮攻防对话,不只是一问一答,而是跟踪上下文并动态调整攻击策略
  • Target 抽象层:统一接口对接不同目标(OpenAI API、Azure AI、本地模型、甚至自定义 Agent)
  • Scoring 引擎:不只看"中没中招",而是给每次攻击结果打分,量化风险等级
  • 转换器(Converters):对攻击 payload 自动编码/变形(Base64、ROT13、Unicode 变形等)

PyRIT 的强项在于模拟真实攻击者的行为模式——不是盲打一通预设 payload,而是根据目标反馈动态调整攻击路径。

⚠️ 但有个重大问题……

PyRIT 已于 2026 年 3 月被 Microsoft 归档(Archived)。

GitHub 仓库 Azure/PyRIT 已进入只读状态,不再有提交、发布和 Issue 响应。官方推荐转向 Azure AI Foundry 内置的红队工具。

这意味着:

  • 你不能再依赖 PyRIT 获取新攻击场景的覆盖
  • 如果将来 AGI 安全威胁演进,PyRIT 不会跟着更新
  • 社区 Fork 可能延续,但失去了官方维护

对一个安全工具来说,无法持续更新的风险比某些漏洞更大——因为攻击手法在进化,你不更新就意味着筛查能力在倒退。

AI-Infra-Guard:AI 基础设施的全面体检

AI-Infra-Guard(简称 AIG)是 2025 年腾讯开源的全栈 AI 红队平台,GitHub 3.9k+ stars。

如果说 garak 是扫 LLM 模型层的、PyRIT 是自动化红队流程的,那 AI-Infra-Guard 的定位就完全不同——它的目标不是"测模型",而是扫描 AI 生态系统中的全部攻击面

五大扫描域

AIG 把安全测试分成五个独立的扫描模块:

① ClawScan(OpenClaw 安全扫描)

一键评估 OpenClaw 部署的安全性——不安全配置、恶意 Skill、已知 CVE、隐私泄露。考虑到 OpenClaw 在 2026 年已经成为事实上的桌面 Agent 标准(WorkBuddy、千问办公等均兼容其 Skill 生态),这个扫描场景的价值相当大。

② Agent Scan(多智能体扫描)

独立的多 Agent 自动化扫描框架,评估 AI Agent 工作流的整体安全性。不像 garak 只测模型层,Agent Scan 会测试 Agent 工作流的工具调用路径、权限边界、数据流动

③ AI Infra Vulnerability Scan

识别 30+ 种 AI 框架组件(Ollama、ComfyUI、vLLM、LangFlow 等),覆盖 400+ 已知 CVE。这对实际部署 AI 基础设施的团队来说非常实用——你很可能不知道你用的某个开源推理框架已经出了 RCE 漏洞。

④ MCP Server & Skills Scan

专门扫描 MCP 服务器的安全性——检查工具接口、权限配置、以及是否暴露了不该暴露的能力。考虑到 MCP 正在成为 Agent 工具调用的标准协议,这个模块的针对性很强。

⑤ Jailbreak Evaluation

类似 garak,测试 LLM 本身对越狱攻击的抵抗力。但 AIG 在这个模块上结合了自身对 Agent 生态的理解,预置的攻击场景更贴近 Agent 实际使用时的攻击面。

使用体验

AIG 提供了 Web UI 界面(不像 garak 纯 CLI),同时也提供了 MCP Server 接口——这意味着你可以把 AIG 本身作为一个工具接入到你的 Agent 工作流中,实现"Agent 自我安全巡检"的闭环。

我的推荐矩阵

三款工具的定位其实不重叠——它们测的是不同层面的东西。

你的场景决定工具选择

场景 推荐工具 原因
我只是想快速验证 LLM 本身的安全性 garak 上手最快,一个命令跑全部,7.5k+社区活跃
我需要做企业级红队测试/合规审计 AI-Infra-Guard 覆盖最广(模型+Agent+Infra+MCP),Web UI 友好,持续维护
我的团队有专门的红队安全工程师 garak + AI-Infra-Guard 组合 garak 扫模型层,AIG 扫基础设施和 Agent 层,互补
我在用 PyRIT 想迁移 AI-Infra-Guard PyRIT 已归档,AIG 是目前最全面的替代方案
我需要通过 EU AI Act 合规测试 AI-Infra-Guard 全栈覆盖最难过的合规项(Agent、Infra、模型三合一)

为什么不推荐"只用一个"?

因为这三个工具测的根本不是同一层:

garak:模型层(Token In/Out)
                    ↕
PyRIT(已归档):红队对话层(多轮攻击)
                    ↕
AI-Infra-Guard:基础设施 + Agent 工作流 + MCP + Skill 生态

一个 Agent 的安全 = 模型安全 + 工具链安全 + 基础设施安全 + 工作流安全

只扫模型层就上线,就像只检查了引擎就把车上路——刹车和方向盘可能全都有问题。

写在最后

2026 年,AI 安全评测工具终于走出了"有没有工具可用"的阶段,进入了"该组合哪些工具"的新阶段。

三款工具的选择,本质上是一个不错的分层决策问题

  • garak 解决的是 “模型本身有没有漏洞”
  • AI-Infra-Guard 解决的是 “AI 系统的所有外围组件有没有漏洞”
  • PyRIT(已归档)曾经解决的是 “如何自动化红队对话流程”

如果你现在从零开始搭建 AI 安全评测体系,我的建议是:

先用 garak 快速摸清模型底牌,再用 AI-Infra-Guard 做全栈扫描。两步走下来,你就有了一个覆盖"模型 + Agent + 基础设施"的完整安全基线。

至于 PyRIT——它曾经是开创者,但已经被时代抛下了。对一个安全工具来说,最致命的不是漏洞,而是停止进化。

By AI博士 万戈