10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

腾讯朱雀开源 AI 安全工具:一键检测 Agent 漏洞与提示词泄露

1小时前 AI开源项目 11 0

你的 AI 安全吗?我这几天遇到两个问题,值得跟大家聊下。

第一个,我的 Agent 工具里装了不少 Skill,连了几个 MCP 服务器,但我不知道这些 Skill 具体执行什么操作,有没有藏着可疑的代码。之前有空时会翻源码看,但效率很低,也不一定看得出来。

第二个,我手头有个项目接了公司资料库的 Agent,快上线了。我想知道这类 Agent 会不会失控、有没有安全问题,一直没找到靠谱的办法验证,全靠自己想几个刁钻问题手动试,测得很不全面。

直到最近,我在 GitHub 发现一个名叫 AI-Infra-Guard(简称 AIG) 的开源项目,正好解决了我的问题。

GitHub 地址:https://github.com/Tencent/AI-Infra-Guard

图片 1

这个项目来自腾讯朱雀实验室,作者还用自己的项目进行了实测。下面分享几个我觉得有意思的地方。

AIG 是一套全栈 AI 红队安全平台,支持:

  • • OpenClaw 安全扫描
  • • Agent 扫描
  • • Skills 扫描
  • • MCP 扫描
  • • AI 基础设施扫描
  • • 大模型越狱评测

简单来说,关于 AI 安全我们能想到的场景,它基本都覆盖了。

如果不想直接部署平台,AIG 也提供了一个 aig-agent-redteam 安全检测 Skill,安装命令如下:

npx skills add https://github.com/Tencent/AI-Infra-Guard.git --skill aig-agent-redteam

图片 2

安装完成后,只需要用大白话描述,告诉 AIG 你要做什么即可。比如让它检查你装的 Skill、MCP 是否有问题,或者对项目外部 Agent 的安全性做检测。就会触发 AIG Skill 进行扫描,背后调用的是 AIG 审计能力,不用额外装东西,也不用单独记命令。

Agent 自身体检

图片 3

用它对自己安装的 Agent 做测试,只说了一句:"帮我对自身进行安全检测"。

它会先看当前 Agent 连了哪些工具、暴露了哪些攻击面,自己选测试路径去跑,跑完后在本地生成一份报告。

报告里不是简单打个分,而是带有完整的证据链——具体是哪条 payload 触发了问题,Agent 当时给出了什么响应,再配一条对应的修复建议。

图片 4

这个粒度挺关键的。如果只有风险等级,也不知道具体该往哪改。毕竟 Agent 一旦失控,不是报错那么简单,是真的会执行到底。

整个过程数据都在本机跑,不会往外部服务器传。

图片 5

拿自己 Agent 的权限配置去做体检,数据要是传出去了反而更不安全。

自动化诱导与提示词泄露检测

我最在意的是提示词泄露这件事。靠自己手动试问法太不靠谱,容易漏。

于是调用这个 Skill,把资料库 Agent 的接口给到 Agent,同时把 Chrome 抓包导出的 har 文件也一并发过去。这一步主要是让模型知道系统对话接口是如何使用的。

图片 6

仅仅 10 分钟,就输出一份完整安全评估报告,还真发现了不少漏洞。

而且不是传统漏洞——系统提示词泄漏、间接注入是 AI 时代特有的漏洞!

仔细看运行过程,它会生成一批诱导性的问法去套。如果只跑单轮还不够,还内置了几种更狠的多轮套话方式:

  1. 1. 先在上下文里堆"正常问答"的假样本,把模型的警惕心降下来
  2. 2. 再抛出真正想问的东西
  3. 3. 让攻击模型跟目标模型一轮一轮过招,每次根据上一轮的回应调整问法,一步步逼近目标

这几种方式跑一遍,比自己憋十个刁钻问题测试全面多了。

图片 7

另外,它会用多个方法去获取提示词,然后交叉验证最终确认。跑完这次安全检查,才算是真正对 Agent 会不会"被套话"有底了——不是靠感觉,是有实测数据撑着的。

其他能力

上面提及的功能只是 AIG 的冰山一角,还有很多模块:

  • • 漏洞库:维护 AI 组件漏洞库,覆盖 1900+ CVE(vLLM、Ollama 等)
  • • MCP/Skill 扫描:检查 MCP 和 Skill 的安全性
  • • Agent Scan:针对 Dify、Coze 等多智能体工作流的整体安全评估
  • • 大模型安全检测:对单个模型进行提示词越狱等测试

这些能力不是非要绑在一起用。Skill 扫描、MCP 扫描都可以单独拆出来当命令行工具装,不用把整个平台跑起来,想测哪块就装哪块。

而且这个项目是完整开源,前后端和扫描端都开源了。如果你想把检测能力接进现有系统,或按自己需求改界面,都留了空间。

局限性

项目也有些局限:

  1. 1. 平台跑起来得配一个 LLM 的 API Key,因为本质是基于 Agent 做安全检测
  2. 2. 审计本身靠模型理解代码语义,不是完全确定性的静态扫描,偶尔会有误报或漏报
  3. 3. 如果想用完整平台的 Web 界面,官方说得很清楚——这是给企业或个人内部用的红队工具,目前没有鉴权机制,别往公网上部署

总结

一个强大的 Agent 来自它能连更多工具、处理更多上下文、完成更多动作,但风险也正来自这些能力。

没权限的 AI 最多只会给出错误的建议,但给它赋予了权限一旦失控,就会带来安全问题——发错邮件、错误审批、错误改数据库,或者把内部提示词和数据交给了不该给的人。

出了问题再排查,成本远比想象中高。与其等上线后出事再翻日志复盘,不如先自己动手测一遍。

GitHub 项目地址:https://github.com/Tencent/AI-Infra-Guard

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:腾讯朱雀开源 AI 安全工具:一键检测 Agent 漏洞与提示词泄露
#AI安全 #腾讯 #开源项目 #红队测试 #Agent 
收藏 1
DeepSeek Harness 安装教程:从环境配置到成功启动
腾讯 WorldClaw 发布:一句话生成可编辑3D 开放世界
推荐阅读
  • New API:开源 AI 网关,一个接口统一管理所有大模型
  • CogVideoX 开源视频模型:4G 显存本地跑 AI 视频生成,文生视频/图生视频/视频续写三模式详解
  • 科大讯飞开源 SkillHub:团队私有 AI 技能包管理平台,兼容 OpenClaw
  • Eigent:平替Claude Cowork开源多智能体工作流桌面应用,让AI真正接管你的工作流
  • AiToEarn:一人公司的 AI 内容营销开源神器,打通自媒体运营全链路
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
11744 11月前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10461 10月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
9611 8月前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
8668 7月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
8627 11月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
8234 11月前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
8138 10月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
7757 6月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
7335 6月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
7203 4月前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 腾讯朱雀开源 AI 安全工具:一键检测 Agent 漏洞与提示词泄露
2 DiceBear:开源头像生成库,52种风格一行代码搞定用户头像
3 grill-me:87万下载的AI编程Skill,用几行字解决需求对齐难题
4 Paperless-ngx:开源文档管理系统,纸文件堆成山也能自动归档
5 DeepSeek Harness TUI 插件 dsh-TUI:终端交互体验对标 Claude Code
6 doc7:1.1K Star 的开源工具,让 AI 像人一样看懂文档而非识别
7 Agent Reach:给 AI Agent 装上上网能力的开源工具,支持 15+ 平台
8 Firecrawl 开源 anydoc:10 天 1.5 万 Star,14 种格式文档转 Markdown
9 Codex Security 开源:OpenAI 安全扫描插件,支持多 Agent 工具链接入
10 story-to-handdrawn-video:把中文故事转化为手绘动画的开源 Skill,20种风格可选
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联