你的 AI 安全吗?我这几天遇到两个问题,值得跟大家聊下。
第一个,我的 Agent 工具里装了不少 Skill,连了几个 MCP 服务器,但我不知道这些 Skill 具体执行什么操作,有没有藏着可疑的代码。之前有空时会翻源码看,但效率很低,也不一定看得出来。
第二个,我手头有个项目接了公司资料库的 Agent,快上线了。我想知道这类 Agent 会不会失控、有没有安全问题,一直没找到靠谱的办法验证,全靠自己想几个刁钻问题手动试,测得很不全面。
直到最近,我在 GitHub 发现一个名叫 AI-Infra-Guard(简称 AIG) 的开源项目,正好解决了我的问题。
GitHub 地址:https://github.com/Tencent/AI-Infra-Guard

这个项目来自腾讯朱雀实验室,作者还用自己的项目进行了实测。下面分享几个我觉得有意思的地方。
AIG 是一套全栈 AI 红队安全平台,支持:
- • OpenClaw 安全扫描
- • Agent 扫描
- • Skills 扫描
- • MCP 扫描
- • AI 基础设施扫描
- • 大模型越狱评测
简单来说,关于 AI 安全我们能想到的场景,它基本都覆盖了。
如果不想直接部署平台,AIG 也提供了一个 aig-agent-redteam 安全检测 Skill,安装命令如下:
npx skills add https://github.com/Tencent/AI-Infra-Guard.git --skill aig-agent-redteam

安装完成后,只需要用大白话描述,告诉 AIG 你要做什么即可。比如让它检查你装的 Skill、MCP 是否有问题,或者对项目外部 Agent 的安全性做检测。就会触发 AIG Skill 进行扫描,背后调用的是 AIG 审计能力,不用额外装东西,也不用单独记命令。
Agent 自身体检

用它对自己安装的 Agent 做测试,只说了一句:"帮我对自身进行安全检测"。
它会先看当前 Agent 连了哪些工具、暴露了哪些攻击面,自己选测试路径去跑,跑完后在本地生成一份报告。
报告里不是简单打个分,而是带有完整的证据链——具体是哪条 payload 触发了问题,Agent 当时给出了什么响应,再配一条对应的修复建议。

这个粒度挺关键的。如果只有风险等级,也不知道具体该往哪改。毕竟 Agent 一旦失控,不是报错那么简单,是真的会执行到底。
整个过程数据都在本机跑,不会往外部服务器传。

拿自己 Agent 的权限配置去做体检,数据要是传出去了反而更不安全。
自动化诱导与提示词泄露检测
我最在意的是提示词泄露这件事。靠自己手动试问法太不靠谱,容易漏。
于是调用这个 Skill,把资料库 Agent 的接口给到 Agent,同时把 Chrome 抓包导出的 har 文件也一并发过去。这一步主要是让模型知道系统对话接口是如何使用的。

仅仅 10 分钟,就输出一份完整安全评估报告,还真发现了不少漏洞。
而且不是传统漏洞——系统提示词泄漏、间接注入是 AI 时代特有的漏洞!
仔细看运行过程,它会生成一批诱导性的问法去套。如果只跑单轮还不够,还内置了几种更狠的多轮套话方式:
- 1. 先在上下文里堆"正常问答"的假样本,把模型的警惕心降下来
- 2. 再抛出真正想问的东西
- 3. 让攻击模型跟目标模型一轮一轮过招,每次根据上一轮的回应调整问法,一步步逼近目标
这几种方式跑一遍,比自己憋十个刁钻问题测试全面多了。

另外,它会用多个方法去获取提示词,然后交叉验证最终确认。跑完这次安全检查,才算是真正对 Agent 会不会"被套话"有底了——不是靠感觉,是有实测数据撑着的。
其他能力
上面提及的功能只是 AIG 的冰山一角,还有很多模块:
- • 漏洞库:维护 AI 组件漏洞库,覆盖 1900+ CVE(vLLM、Ollama 等)
- • MCP/Skill 扫描:检查 MCP 和 Skill 的安全性
- • Agent Scan:针对 Dify、Coze 等多智能体工作流的整体安全评估
- • 大模型安全检测:对单个模型进行提示词越狱等测试
这些能力不是非要绑在一起用。Skill 扫描、MCP 扫描都可以单独拆出来当命令行工具装,不用把整个平台跑起来,想测哪块就装哪块。
而且这个项目是完整开源,前后端和扫描端都开源了。如果你想把检测能力接进现有系统,或按自己需求改界面,都留了空间。
局限性
项目也有些局限:
- 1. 平台跑起来得配一个 LLM 的 API Key,因为本质是基于 Agent 做安全检测
- 2. 审计本身靠模型理解代码语义,不是完全确定性的静态扫描,偶尔会有误报或漏报
- 3. 如果想用完整平台的 Web 界面,官方说得很清楚——这是给企业或个人内部用的红队工具,目前没有鉴权机制,别往公网上部署
总结
一个强大的 Agent 来自它能连更多工具、处理更多上下文、完成更多动作,但风险也正来自这些能力。
没权限的 AI 最多只会给出错误的建议,但给它赋予了权限一旦失控,就会带来安全问题——发错邮件、错误审批、错误改数据库,或者把内部提示词和数据交给了不该给的人。
出了问题再排查,成本远比想象中高。与其等上线后出事再翻日志复盘,不如先自己动手测一遍。
GitHub 项目地址:https://github.com/Tencent/AI-Infra-Guard