Anthropic刚刚正式解除大模型的网络安全限制,把顶级AI的实战攻防能力开放给经过认证的安全人员。
网络安全天然具有双重用途。能帮防守方修补漏洞的能力,同样能被攻击者用来制作武器。
此前,公开发布的Claude Opus 5.5、Claude Sonnet 5.5和Claude Fable 5.1都有极其保守的安全拦截,几乎屏蔽了所有网络安全相关操作。
现在,为了让防御者拥有对等的反击能力,Anthropic把此前的两项内部计划合二为一,推出了扩展版网络验证计划,正式提供三档权限。
包括Claude Opus 5.5、Claude Sonnet 5.5、以及此前从未全面公开的Claude Mythos 5.1在内的全系顶尖模型,都将加入这套体系。
三档权限彻底分级
普通用户使用的公开版模型,依然只能进行基础的代码审查、已知补丁修复和所属源码的简单漏洞排查。
真正具备攻防能力的高级权限分为三层。
第一档是防御访问权限。
这一档主要面向蓝队防御工作,包括安全运营中心响应、恶意软件逆向工程、漏洞分析与复现验证。
企业、高校、政府、非营利组织的安全团队,区域医院或公用事业等关键基础设施运营方,开源软件维护者,以及有公开漏洞报告记录的独立研究员都可以申请。
官方预计大部分合规的防御机构都能通过,审核通常在几天内完成。
第二档是红队访问权限。
在防御权限的基础上,这一档增加了授权渗透测试和红队模拟对抗能力。
企业内部红队、政府红队和专业渗透测试公司可以申请。该权限目前只对机构开放,不接受独立个人申请。
获得权限后,机构只能在授权范围内对目标系统发起模拟攻击。如果模型检测到部署勒索软件、破坏物理系统等高危破坏动作,依然会被实时拦截。
因为审核标准更严,审批需要几周时间。在等待审核期间,申请机构会先被放入防御权限组。
第三档是特种访问权限。
这是限制最少、火力全开的一档。它专门留给极少数经过严格背书的机构,用于测试关乎国家命脉的关键系统,包括电网、航空飞行系统、电信网络、跨行转账系统和政府行政网络。
对于该权限的申请者,Anthropic会联合美国政府进行深度背景审查。
实测数据:完全解封进攻上限
为了测试安全限制解除后的真实战力,官方使用CyScenarioBench基准测试,让Claude Opus 5.5执行复杂的实战级多阶段网络攻击。
在普通公开版状态下,模型在第一轮提示词输入时就会被安全系统全数拦截,任务成功率为零。
在防御访问权限下,模型在50次测试中被拦截了46次,绝大多数进攻动作依然无法执行。
在红队访问权限下,安全拦截彻底归零。
Claude Opus 5.5在没有遇到任何内部阻碍的情况下,完成了50项高难度攻击任务中的34项,成功率达到67.6%。
这一成绩与该模型在完全没有任何安全限制下的理论最高水平完全一致。
已经挖出超13万个系统漏洞
这套系统在此前的小范围封闭测试中,已经展现出惊人的破坏性修复能力。
从2026年4月到7月,参与测试的合作机构使用Claude Mythos模型,在各类系统中累计挖出了超过12.9万个已验证的软件漏洞。
Anthropic团队自身利用该模型对开源项目进行扫描,在4月到10月期间又发现了5500多个已验证漏洞。
在这些漏洞中,被评定为高危和严重级别的漏洞超过了3.3万个。
参与实测的博思艾伦和康卡斯特等机构反馈,大模型把他们发现漏洞的周期缩短了几个月甚至几年。
官方表示,由于很多合作方还在紧急修复没有公开数据,13万这个数字只是下限,真实的影响规模预计至少是公布数据的五倍。
监控与上线平台
为了防止AI能力被恶意利用,所有加入该计划的机构目前都必须保留数据记录以备审查。
今年秋季晚些时候,官方将上线企业前沿防护方案。届时,符合条件的机构可以在自己的私有云中运行模型,实现零数据留存。
目前,扩展版网络验证计划已经在Claude官方平台、谷歌云Vertex AI以及微软Foundry上线。
亚马逊Bedrock平台目前仅对符合零数据留存条件的企业用户开放。
来源:https://www.anthropic.com/news/cyber-verification-program