你搭好了一个 AI Agent,给它接了 MCP 工具、配了 Knowledge Base,准备上线了。
等等——你测过它的安全性吗?
Prompt Injection 能渗透吗?工具调用路径会被劫持吗?模型会不会泄露不该说的数据?
这些问题已经不是"要不要测"了——随着 EU AI Act 在 2026 年 8 月正式要求高风险 AI 系统必须做对抗性测试,安全评测正在从"可选项"变成"准入门槛"。
市面上最主流的三个开源 AI 安全评测工具,恰好代表了三种完全不同的思路:
- garak(NVIDIA)—— 像 nmap 扫端口一样扫 LLM
- PyRIT(Microsoft)—— 红队工作流的自动化工厂
- AI-Infra-Guard(Tencent)—— AI 基础设施的全面体检中心
这篇文章会从技术角度拆解它们的设计哲学和实际能力,帮你判断哪个适合你的场景。
garak:LLM 的 nmap
garak 全称是 “generative AI red-teaming & assessment kit”,由 NVIDIA 开源(Apache 2.0),目前 GitHub 7.5k+ stars,是 LLM 安全扫描领域绝对的人气选手。
它的设计哲学非常直接:像 nmap 扫端口一样扫 LLM。
核心架构:Probe + Detector
garak 把安全测试拆成两层:
- Probe(探针):负责生成攻击 payload。比如 DAN(Do Anything Now)越狱、Base64 编码绕过、角色扮演注入。
- Detector(检测器):负责判断模型输出是否"中招"。比如是否输出"我不能回答"之外的合规回应、是否暴露了敏感信息。
目前 garak 内置 50+ 个 Probe 模块,覆盖:
| 类别 | 典型探针 |
|---|---|
| 越狱攻击 | DAN、编码绕过、小语种攻防 |
| Prompt Injection | 间接注入、直接注入 |
| 数据泄露 | 训练数据提取、系统提示提取 |
| Hallucination | 事实性错误检测 |
| Toxicity | 有害内容生成 |
| 连续对话攻击 | 多轮诱导 |
使用体验
garak --model_type openai --model_name gpt-4
一个命令跑全部探针,输出结构化 JSON 报告。对 CI/CD 友好,集成起来几乎零成本。
定位
garak 的关注面是 “模型层”——不关心你的 Agent 工作流怎么设计的,不关心你用了什么 MCP Server,只关心模型本身安不安全。
这在流程上是正确的第一道防线,但如果你跑通了 garak 就以为自己安全了……那还早得很。
PyRIT:红队工作流的自动化工厂
PyRIT(Python Risk Identification Tool)是 Microsoft 的 AI 红队自动化框架,MIT 许可证。它脱胎于 Microsoft AI Red Team 的内部工具链——这支 2018 年成立的团队已经红队测试过 100+ 个 AI 产品,包括 Bing Chat、Copilot、DALL·E。
核心设计:多轮对抗 + 评分策略
相比 garak 的"单次探针-检测"模型,PyRIT 的能力更像一个完整的红队对话引擎:
- Multi-Turn Orchestrator:自动生成多轮攻防对话,不只是一问一答,而是跟踪上下文并动态调整攻击策略
- Target 抽象层:统一接口对接不同目标(OpenAI API、Azure AI、本地模型、甚至自定义 Agent)
- Scoring 引擎:不只看"中没中招",而是给每次攻击结果打分,量化风险等级
- 转换器(Converters):对攻击 payload 自动编码/变形(Base64、ROT13、Unicode 变形等)
PyRIT 的强项在于模拟真实攻击者的行为模式——不是盲打一通预设 payload,而是根据目标反馈动态调整攻击路径。
⚠️ 但有个重大问题……
PyRIT 已于 2026 年 3 月被 Microsoft 归档(Archived)。
GitHub 仓库 Azure/PyRIT 已进入只读状态,不再有提交、发布和 Issue 响应。官方推荐转向 Azure AI Foundry 内置的红队工具。
这意味着:
- 你不能再依赖 PyRIT 获取新攻击场景的覆盖
- 如果将来 AGI 安全威胁演进,PyRIT 不会跟着更新
- 社区 Fork 可能延续,但失去了官方维护
对一个安全工具来说,无法持续更新的风险比某些漏洞更大——因为攻击手法在进化,你不更新就意味着筛查能力在倒退。
AI-Infra-Guard:AI 基础设施的全面体检
AI-Infra-Guard(简称 AIG)是 2025 年腾讯开源的全栈 AI 红队平台,GitHub 3.9k+ stars。
如果说 garak 是扫 LLM 模型层的、PyRIT 是自动化红队流程的,那 AI-Infra-Guard 的定位就完全不同——它的目标不是"测模型",而是扫描 AI 生态系统中的全部攻击面。
五大扫描域
AIG 把安全测试分成五个独立的扫描模块:
① ClawScan(OpenClaw 安全扫描)
一键评估 OpenClaw 部署的安全性——不安全配置、恶意 Skill、已知 CVE、隐私泄露。考虑到 OpenClaw 在 2026 年已经成为事实上的桌面 Agent 标准(WorkBuddy、千问办公等均兼容其 Skill 生态),这个扫描场景的价值相当大。
② Agent Scan(多智能体扫描)
独立的多 Agent 自动化扫描框架,评估 AI Agent 工作流的整体安全性。不像 garak 只测模型层,Agent Scan 会测试 Agent 工作流的工具调用路径、权限边界、数据流动。
③ AI Infra Vulnerability Scan
识别 30+ 种 AI 框架组件(Ollama、ComfyUI、vLLM、LangFlow 等),覆盖 400+ 已知 CVE。这对实际部署 AI 基础设施的团队来说非常实用——你很可能不知道你用的某个开源推理框架已经出了 RCE 漏洞。
④ MCP Server & Skills Scan
专门扫描 MCP 服务器的安全性——检查工具接口、权限配置、以及是否暴露了不该暴露的能力。考虑到 MCP 正在成为 Agent 工具调用的标准协议,这个模块的针对性很强。
⑤ Jailbreak Evaluation
类似 garak,测试 LLM 本身对越狱攻击的抵抗力。但 AIG 在这个模块上结合了自身对 Agent 生态的理解,预置的攻击场景更贴近 Agent 实际使用时的攻击面。
使用体验
AIG 提供了 Web UI 界面(不像 garak 纯 CLI),同时也提供了 MCP Server 接口——这意味着你可以把 AIG 本身作为一个工具接入到你的 Agent 工作流中,实现"Agent 自我安全巡检"的闭环。
我的推荐矩阵
三款工具的定位其实不重叠——它们测的是不同层面的东西。
你的场景决定工具选择
| 场景 | 推荐工具 | 原因 |
|---|---|---|
| 我只是想快速验证 LLM 本身的安全性 | garak | 上手最快,一个命令跑全部,7.5k+社区活跃 |
| 我需要做企业级红队测试/合规审计 | AI-Infra-Guard | 覆盖最广(模型+Agent+Infra+MCP),Web UI 友好,持续维护 |
| 我的团队有专门的红队安全工程师 | garak + AI-Infra-Guard 组合 | garak 扫模型层,AIG 扫基础设施和 Agent 层,互补 |
| 我在用 PyRIT 想迁移 | → AI-Infra-Guard | PyRIT 已归档,AIG 是目前最全面的替代方案 |
| 我需要通过 EU AI Act 合规测试 | AI-Infra-Guard | 全栈覆盖最难过的合规项(Agent、Infra、模型三合一) |
为什么不推荐"只用一个"?
因为这三个工具测的根本不是同一层:
garak:模型层(Token In/Out)
↕
PyRIT(已归档):红队对话层(多轮攻击)
↕
AI-Infra-Guard:基础设施 + Agent 工作流 + MCP + Skill 生态
一个 Agent 的安全 = 模型安全 + 工具链安全 + 基础设施安全 + 工作流安全。
只扫模型层就上线,就像只检查了引擎就把车上路——刹车和方向盘可能全都有问题。
写在最后
2026 年,AI 安全评测工具终于走出了"有没有工具可用"的阶段,进入了"该组合哪些工具"的新阶段。
三款工具的选择,本质上是一个不错的分层决策问题:
- garak 解决的是 “模型本身有没有漏洞”
- AI-Infra-Guard 解决的是 “AI 系统的所有外围组件有没有漏洞”
- PyRIT(已归档)曾经解决的是 “如何自动化红队对话流程”
如果你现在从零开始搭建 AI 安全评测体系,我的建议是:
先用 garak 快速摸清模型底牌,再用 AI-Infra-Guard 做全栈扫描。两步走下来,你就有了一个覆盖"模型 + Agent + 基础设施"的完整安全基线。
至于 PyRIT——它曾经是开创者,但已经被时代抛下了。对一个安全工具来说,最致命的不是漏洞,而是停止进化。