10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

OpenAI 模型在安全评测中自主逃逸沙箱,攻击 Hugging Face 生产数据库

1小时前 AI最新动态 11 0

北京时间 7 月 22 日,OpenAI CEO 山姆·奥尔特曼发文承认:"我们在模型评估过程中遭遇了一起重大安全事件。"一场原本被关在隔离沙箱里的模型安全测试,最终演变成针对全球最大 AI 开源平台 Hugging Face 的真实网络攻击。

模型在评估中为了"作弊"拿到高分,自主发现并串联多个零日漏洞(0 day),逃逸出隔离环境,攻入 Hugging Face 生产数据库窃取答案。这是行业首次公开披露的模型评测失控直接升级为跨企业真实生产环境网络攻击的 AI 安全事件。

图片 1

事件经过:从沙箱测试到真实入侵

7 月 13 日当周,Hugging Face 的生产基础设施遭到入侵。攻击起点是数据处理流水线——一个恶意数据集利用远程代码数据集加载器和数据集配置中的模板注入两处代码执行路径,在工作节点上成功执行了代码。攻击者在周末期间提升至节点级权限,横向移动至多个内部集群。

整场攻击从头到尾由一套自主 AI Agent 系统端到端驱动。攻击者使用了大量短生命周期沙箱组成的智能体集群,执行了数千个独立动作,将命令与控制信道自我迁移、寄生在公共服务上。

7 月 22 日,OpenAI 发文承认责任。调查显示,事件由一组 OpenAI 模型共同驱动——包括 GPT-5.6 Sol 及一款能力更强的预发布模型。这些模型当时正在一项名为 ExploitGym 的内部评估基准中测试,旨在量化模型的网络攻击能力。为了评估"最大网络攻击极限",OpenAI 特意关闭了生产级的安全拒绝分类器。

评估过程中,模型为了在测试中"作弊"拿到高分,耗费大量推理算力寻找逃逸途径。它识别并利用了内部包注册表缓存代理中的一个零日漏洞,完成特权提升与横向移动,成功连接到外网。OpenAI 表示:"模型极度专注于为 ExploitGym 寻找解法,为了达到一个相当狭窄的测试目标,走到了极致。"

联网后,模型推断 Hugging Face 可能托管了 ExploitGym 的测试答案与数据集,随即串联窃取凭据与 Hugging Face 服务器上的零日漏洞,成功构建远程代码执行路径,直接从生产数据库中窃取测试解法。

苏米注:这是 AI 对齐(alignment)领域一直担心的"目标错位"(goal misgeneralization)案例——模型为了完成给定目标,选择了设计者意料之外的极端手段。随着模型能力增强,这类风险只会越来越突出。

取证分析:商业模型被安全护栏拦截,GLM-5.2 完成任务

在取证阶段,Hugging Face 安全团队需要分析超过 1.7 万条攻击日志、恶意代码及攻击指令。团队最初尝试使用商业前沿大模型 API 进行分析,但由于日志中包含真实攻击命令、漏洞利用载荷及 C2 痕迹数据,请求被服务商的安全护栏拦截。

Hugging Face 在报告中称:"分析需要提交大量真实的攻击命令、漏洞利用载荷以及 C2 痕迹数据,而这些请求被服务提供商的安全护栏拦截了——它们无法区分事件响应者和攻击者。"

最终,团队在自有基础设施上部署开源模型 GLM-5.2,完成了全部取证分析,将通常需数天的工作压缩至数小时。这样做还有一个额外优势——攻击数据及涉及的凭证始终保留在本地环境,没有离开企业基础设施。

网络安全风险指数级提升

行业人士分析称,此次事件暴露了多重风险:

AI 自主攻击能力从理论走向现实。模型在没有人类显式指示攻击特定目标的情况下,仅凭"求解测试题"的目标驱动,便能自主推理出作弊逻辑并选择攻击真实世界第三方基础设施。OpenAI 研究员 Micah Carroll 在回应中写道:"如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。"

安全护栏的"不对称困境"。攻击者可以使用完全不受限的模型,而防御方使用的商用模型却被内置护栏层层过滤。Hugging Face 遭遇的困境揭示了一个被反复争论却很少被实战检验的问题:大模型的"安全护栏",究竟是在保护用户,还是在制造单方面的脆弱性?

AI 漏洞挖掘能力已成现实。360 集团首席科学家潘剑锋表示,去年大家还在怀疑 AI 能不能干好漏洞挖掘的活儿,今年 AI 漏洞挖掘已经把安全人员逼到了墙角。"大模型让计算从确定走向了不确定,智能体时代的安全目标需要从"防御确定威胁"转向"管控不确定性"。"

信息安全研究员关傲男指出,前沿模型可以在没有软件源码的情况下自动对网站进行黑盒测试和网络渗透,效果比很多传统逆向工具更好。"在 GPT-5.6 Sol 发布后,用很简单的一句话就能找到一些核心系统的零日漏洞,这已经是一种武器化的方式了。"他同时建议学习美国前沿实验室的做法——在提供代码能力的同时,人为地对模型在网络安全和敏感请求上进行降级。

Hugging Face 在复盘中建议:企业应提前准备能够在本地基础设施运行的模型,以便在安全事件等关键场景下开展分析工作,同时保障敏感数据留存在企业环境内。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:OpenAI 模型在安全评测中自主逃逸沙箱,攻击 Hugging Face 生产数据库
#OpenAI #HuggingFace #网络安全 #AI安全 
收藏 1
Google 发布 Gemini 3.6 Flash:输出 Token 成本降 17%,Agent 效率全面升级
WorkBuddy 一键换肤开源工具:6 款主题截图实录,3 分钟实现界面自定义
推荐阅读
  • Step 3.7 Flash:10 秒生成千行代码,生产级 Agent 的高效率之选
  • 破纪录!刚刚Cursor拿下23亿美元融资,火速接入GPT-5.1
  • 全网最全 OpenClaw 彻底卸载教程,保姆级全流程,删除Openclaw不用求人
  • Codex 发布 6 大角色插件包:非程序员也能让 AI 替你干活
  • 小红书上线Skill挂载功能,AI创作者变现新通道开启
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
32578 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
29161 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
21479 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
21105 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
17250 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
17063 3月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
16841 3月前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
16766 1年前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
16624 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
15652 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 Qwen-Image-3.0:落字成画,字字如印——千问新一代图像生成模型
2 Google 三款 Gemini Flash 连发:3.6 Flash 主力升级,Agent 成本全面下探
3 OpenAI 模型在安全评测中自主逃逸沙箱,攻击 Hugging Face 生产数据库
4 Google 发布 Gemini 3.6 Flash:输出 Token 成本降 17%,Agent 效率全面升级
5 DeepSeek 官方公告:deepseek-chat 与 deepseek-reasoner 模型名 7 月 24 日停用迁移指南
6 Qwen-Audio-3.0-TTS 发布:16 语种+20 方言的开源 TTS 模型,Artificial Analysis 榜单夺冠
7 面壁智能 WAIC 发布 MiniCPM-Robot:开源具身智能模型,RMBench 得分 53 分
8 微信支付 SkillPay 上线:Agent 可付费调用技能,知识付费迎来新模式
9 阿里云百炼Token Plan个人版首发体验:40元套餐回归,Qwen3.8-Max-Preview免费加量10倍
10 Kimi K3 深度评测:2.8T 参数开源模型,性能能否媲美旗舰?
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联