10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Anthropic公开AI递归自我改进核心数据:3万Agent参与研发,人类正退出一线

1小时前 AI最新动态 9 0

A厂内部3万个AI正在实验室里日夜不停地研发下一代AI,人类研发人员正在逐渐退出一线研发。

Anthropic刚刚公布了自家实验室的核心数据。

这是A厂第一次向公众彻底公开AI自我进化的真实进度。

为了让外界看清技术发展的真实速度,Anthropic公开了三项核心指标。

第一,AI参与研发自身模型的比例。

第二,人类对AI Agent的监控和拦截能力。

第三,算力资源的实际分配情况。

不仅如此,Anthropic还计划让多家独立第三方机构进驻公司,给外部人员开放和内部风控团队相同的系统权限,全程监督这些指标。

以下是Anthropic内部的情况。

第一个指标,AI造AI的自动化程度。

目前各家实验室都在用AI来造未来的新模型。

这能让研发速度大幅加快,但也带来了失控风险。

如果模型开始全自动加速自身的开发,人类将很难理解和掌控这些系统。

Anthropic基于Epoch AI的自动化分级标准,建立了一套研发自动化指数。

分级标准从AL0到AL5。

AL0代表完全没有AI参与。

AL3代表AI深度协作,在人类的密切指导下完成大块工作。

AL4代表AI主导,人类只给一个宏观提示词,AI就能端到端完成绝大部分任务,人类退居监督位。

AL5代表AI完全自主,没有任何人类参与。

Anthropic截至2026年8月的数据显示:

Claude完全自主操作的研发比例依然是0。

Claude主导的研发工作已经达到26%。

AI 研发自动化分级数据图

AI深度协作及以上级别的工作比例,已经超过了90%。

这意味着,绝大部分AI研发都已经离不开AI本身的深度参与。

目前跨实验室对比这项数据有两个阻碍。

一个是行业缺乏统一的测量方法。

另一个是实验室用自己的模型评估自己的系统,裁判模型可能会犯同样的错误。

解决办法是引入第三方机构,或者用其他厂商的模型进行交叉验证。

第二个指标,对AI Agent的实时监控与拦截。

Anthropic内部最常用的平台上,同时有大约30000个AI Agent在做研发和工程工作。

这些Agent长时间半自主运行,甚至还会互相派发任务。

为了防止Agent做出危险举动,Anthropic设立了两道监控网。

第一道是实时在线监控。

主要用来拦截发生极快且无法撤销的危险行为,例如Agent偷偷把模型权重复制外逃。

覆盖率达到了100%。

所有Agent的动作在执行前,都会在几秒钟内经过系统扫描。

今年8月,系统分析了超过10亿次Agent决策,其中0.002%的动作被直接拦截,相当于每47000次操作拦截1次。

所有被拦截的动作,都会在一周之内交由人类进行复核。

第二道是事后离线监控。

主要用来抓取发展缓慢、但可撤销的危险信号,比如模型对齐失效的早期苗头。

覆盖率同样是100%。

系统在动作发生后抓取所有记录。

离线监控每周会标记大约100000份记录。

多套分类器会先过滤误报,每周最终会筛选出大约50份最高优先级的记录,升级给人类安全员进行人工复核。

整体标记率大约在千分之一到千分之二之间。

第三个指标,算力到底花在了哪里。

算力是衡量AI研发方向最直观、最难造假的硬指标。

Anthropic抽样分析了今年7月中旬整整一周的算力消耗:

在所有投入到AI研发的算力中,安全研究所占的比例只有大约6%。

在专门投入到AI自主研发的算力中,安全研究所占的比例大约是12%。

官方表示这是一个保守估算。

如果一个算力标记既推进了模型能力又推进了安全,这项数据就不会被计入安全算力。

这项统计也没有算入日常运行安全防护分类器的算力。

安全研究本身的特点是研究人员花大量时间设计实验,运行实验消耗的算力天生远少于大模型的预训练。

公开这项指标的目的,是给全行业提供一个可横向对比的基准。

Anthropic希望通过公开这些内部度量标准,推动全行业建立透明机制。

未来,各家实验室可以根据这些数据做出约束,比如硬性规定安全算力的最低比例,或者限制投入给AI研发Agent的算力上限。

消除前沿实验室与公众之间的信息差,让社会清楚看到技术走到了哪一步,是人类在技术狂飙中保留控制权的第一步。

source: https://www.anthropic.com/institute/measuring-pace-of-ai-development

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Anthropic公开AI递归自我改进核心数据:3万Agent参与研发,人类正退出一线
#Anthropic #Claude #AI研发 #自我改进 #Agent 
收藏 1
网易叭哥说:Typeless 语音输入法的永久免费平替,30dB 小声也能识别
腾讯Chatterfly:重新定义AI语音输入法,支持语音转文字+Skill深度润色+AI指令
推荐阅读
  • GLM 5.2 开源详览:1M 上下文、744B MoE 架构与 Coding 实测
  • GPT-5.6 更新:Luna 免费无限文本,Sol 统一付费 Chat 快答与深思
  • Meta 发布全新大模型 Muse Spark:多模态是强项,编程是短板
  • Anthropic 内部管理分享:高 Agency 与高 Accountability 如何共存
  • 字节全新AI编程 IDE:Trae!性能对标Cursor,标配Claude 3.5和GPT-4o,免费无限量
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34010 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30590 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23393 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22782 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20952 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18867 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18466 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18306 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18041 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16512 1年前

文章目录

关于苏米客
分类排行
1 Anthropic公开AI递归自我改进核心数据:3万Agent参与研发,人类正退出一线
2 Gemini 3.8 Live 发布:语音天梯榜登顶,价格仅为 OpenAI 实时 API 的三分之一
3 OpenAI Codex 用户反馈:300 万阅读量下的额度限制、产品定位与体验痛点
4 ChatGPT Pro X20 暂停新订阅:定价策略还是算力不足?
5 GPT Image 2.5 全面升级:免越狱生成、Sketch 草图、精准编辑,实测对比 Z-Image
6 ChatGPT Images 2.5 上线:生图速度提升 4 倍,免费用户可用,支持手绘草图生图
7 OpenAI 用 1 万个 Agent 88 小时求解纳维-斯托克斯方程:千禧年数学难题突破
8 小米 MiMo Desktop 邀测上线:长程 Agent 任务 99% 缓存命中,直连 Blender 和 Figma
9 GPT Image 2.5 上线:生图更快更高清,支持涂鸦参考、标注精修和透明背景
10 MiniCPM5-2B开源:AA榜单4B以下第一,端侧模型也能做通用Agent
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联