10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

Anthropic 两周提速 Claude 3 倍:可衡量就能优化,150 线程并行 + CI 棘轮护栏实战

59分钟前 AI最新动态 0 0

Anthropic 三位工程师在开发者博客上复盘了如何用两周时间,把 claude.ai 网页版和桌面端的核心体验整体提速约 3 倍:打开页面到能打字从 3.1 秒降到 0.55 秒,新开会话从 0.8 秒降到 0.3 秒,加载云端会话从 2.6 秒降到 0.73 秒。13 项指标几何平均快了 3.1 倍,每天能帮用户省下几万小时等待。干活主力是 Claude,整个冲刺跑在一个 Slack 频道里,两周合入 3000 多个改动,零事故零回滚。核心结论就一句话:只要 Claude 能把一件事衡量出来,它就能把这件事变快。

Claude 性能提升数据

核心方法:爬山(Hill Climbing)

性能优化中,测量不再是第零步,而是爬山的第一步。Claude 只要有一个能比较的数,就能开始改代码、跑 benchmark、看数字有没有往下走,而且能异步干好几个小时,一晚上自己试很多轮。杠杆最高的事变成了一件:找到更多可衡量的数据指标。

配套三要素:一是每个 benchmark 先证明自己——压下去后用户真实感受到的耗时也会跟着降,证明不了就下线;二是棘轮(ratchet)——benchmark 写进 CI,数字只许降不许升,PR 让数字变差就不让合并;三是护栏和掌舵——每个改动至少一人审批,用户可见的改动放功能开关后面,高风险的先员工、再 1%、最后全量。

方法示意图

优化循环图

实施过程

设定目标与基线

冲刺开始前建了 Slack 频道,给 Claude 留了常驻指令负责性能事务。Claude 通过 Datadog MCP 分析数据,找出影响最大的四类用户操作:打开 App、开始对话、加载已有对话、发送消息——这四类占用户全部活动的 95%。算上网页端和桌面端,一共 13 项测量。

第三天就达成了 12 个目标。开局留了空间让 Claude 自己找机会,结果 Claude 提出来的方向远超预期,于是重新定目标,继续找更多能数的东西。

寻找确定性指标

他们希望 Claude 验证原型时不用等线上数据回来,所以得在实验室里另找测性能的办法。Sam 提出数 JS 指令数:纯 JS 热路径用 Valgrind 跑 benchmark,加 node --predictable,跟基线比就行。浏览器路径用 React 提交次数、V8 函数调用次数、布局和样式重算次数、DOM 变更次数。

Benchmark 测试结果

一个小时后,两条热路径的指令数分别降了 48% 和 31%,真实耗时分别降了 78% 和 44%。CI 里加了两个新棘轮:任何让指令数变多的 PR 都过不了 CI,每天有个任务,数字降了就把上限往下调。

建立优化循环

稳定循环:有人开讨论串附截图或录屏 → Claude 追踪流程建 benchmark → 实验室拿到结果后带 PR 回来 → 上线后 Claude 盯部署读数据 → 变快了拧紧棘轮,没变就关掉开关继续迭代 → 找下一个慢的地方。

举例:侧边栏会话陆续蹦出来导致页面抖动,CLS 指标几乎检测不到。Claude 建了遥测事件,把每次布局偏移来源对应到有名字的区域和阶段,加了集成测试故意触发偏移,在主分支跑 20 次全红,修复 PR 上跑 20 次全绿。上线后发现 31% 的页面加载在能用后有东西在挪位置,逐个修掉。

布局偏移修复演示

冲刺期间同时跑着 150 多个这样的线程。

并行扩展线程

一个线程跑通后多开就行。单个线程能提 50 个优化 PR,有时到 100 个。越来越多的时候是 Claude 自己在开新线程,追它在排查或定时任务里发现的机会。

破折号导致的双字节存储问题

Claude 全面排查 CPU 卡顿时发现:只要回复 markdown 里有破折号或弯引号等非 Latin-1 字符,V8 就会把整段按 UTF-16 双字节存储,语法高亮正则都被赶到慢路径。修法是一个 20 行改动:高亮前先把代码块复制成单字节字符串。

搭建安全护栏

每个 PR 过自动审查加至少一人审批;单元测试先于优化;用户可见改动放功能开关后面。两周加了近 200 个功能开关,结束时一半以上已清理。

静态输入框是个脆弱设计:HTML 页面副本在上面绘制真正页面,差一个像素就破。所以搭了几十道护栏:jsdom 渲染保证两者不走样、14 种视口逐一比对误差 1 像素内、按键测试交接时持续打字、线上每次交接上报偏移量精确到十分之一像素。

静态输入框交接演示

120Hz 帧预算挑战

为了演示实时语法高亮优化,Claude 搭了 120Hz 测试台,用 DevTools begin-frame 控制做确定性逐帧步进,每帧 8.33 毫秒。每一帧画面只有 8.33ms 预算,Claude 一帧一步找出慢的部分,已输出的块缓存、分词逻辑挪到 worker、表格逐格显示。一个线程合入近 60 个 PR,长回复阻塞主线程从 750ms 降到约 200ms,CPU 占用降到三分之一,120Hz MacBook 上全程稳在 120fps。

@ClaudeDevs 官方推文

经验提炼

提出量化目标

先让 Claude 把「快」变成一个数——页面打开到能点击多少毫秒、打包文件多大、打字触发多少次重渲染。测量从第零步变成爬山的第一步。

量化目标示意图

验证指标有效性

真实的量太吵就换一个稳定的量,前提是先证明两者挂钩。Anthropic 放弃拿毫秒当 CI 闸门改数 CPU 指令数,就是这个逻辑。证明不了的 benchmark 一律下线。

锁定已有成果

每次优化完顺手写检查,把现在的数记下来,以后任何改动让这个数变差就报错。每天数字降了就把上限自动往下调,赢下来的东西就不会在后续改动中悄悄流失。

棘轮机制示意图

先建护栏,再扩并发

Anthropic 同时开 150 多个线程两周 3000+ 改动零事故,靠的是整套护栏:每个改动至少一人审批、单元测试先于优化、用户可见改动放功能开关、高风险先员工再 1% 再全量、每个线程有具名的人负责。

安全护栏示意图

人的三项职责

野心:Claude 默认保守,工程师要鼓励它大胆,Raymond 那句「请勇敢一点」就是。目标达成后挨个线程发话:「继续往下压,野心大一点。」

品味:表格一格一格出还是一行一行出、骨架屏何时出现、逐词淡入值不值得花帧预算——Claude 负责抠毫秒,取舍由人拍板。

方向:线程保持窄,只盯一个 benchmark。人决定先后顺序、合并踩脚线程、边际收益递减时关掉线程。900 行换每次省 2 毫秒?一句话毙掉。

实战验证:4 个网站提速

作者让 agent 照这套方法给自己的 4 个在线网站提速,每个站派一个 agent,目标打开到能用 p75 少九成。

4 个网站提速结果

效果最好的是公众号排版器:实验室里打开到能打字从 2238ms 降到 209ms,少了九成。三招:按需加载图片/粘贴富文本才用的库、Vue 和 markdown-it 回自有域名、照搬静态输入框写进 HTML。

bookai.top 搜索最热门文章首屏图从几千像素压到合适尺寸,桌面端打开到能用从 7776ms 降到 1588ms,少 79.6%。img2046 压缩工具页按需加载两个库,打开到能用少 11%,脚本执行少 29%。个人主页变化不大,头像换 WebP 后 LCP 快 13.4%。

排版器提速结果

测量陷阱避坑

踩了三个坑:一是测量机自己的网络——电脑走代理导致所有站首字节时间都在 1.4s,跟网站无关;二是屏幕宽度——同一张图桌面端在首屏是瓶颈,手机端掉到首屏外测不出变化;三是同时开工——4 个 agent 同台机抢 CPU,轮换先后顺序才拿到可信数字。

Github:https://github.com/alchaincyf/huashu-flash

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Anthropic 两周提速 Claude 3 倍:可衡量就能优化,150 线程并行 + CI 棘轮护栏实战
#Anthropic #Claude #性能优化 #爬山算法 #CI棘轮 
收藏 1
Mobile MCP:开源手机自动化测试工具,支持 Android/iOS 无障碍操作 + AI 图像理解
这是最后一篇
推荐阅读
  • TRAE 大更新:Hook 钩子、全局记忆、Design 模式,IDE 三大核心升级解析
  • SkyClaw 免费 Agent 模型:无限 Token,适配 OpenClaw、Hermes、Nanobot
  • MiniMax 发布 M2.1:速度明显提升
  • 即梦4.0上手体验:六大场景实测,中文创作者的福音,全面硬刚NanoBanana
  • 百度发布首款搭载中文 大模型的小度AI眼镜,支持边走边问、第一视角拍摄
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34152 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30762 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23478 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22912 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
21219 6月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18964 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18595 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18384 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18161 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16590 1年前

文章目录

关于苏米客
分类排行
1 Anthropic 两周提速 Claude 3 倍:可衡量就能优化,150 线程并行 + CI 棘轮护栏实战
2 腾讯QClaw宣布12月停运:AI办公内部赛马结束,WorkBuddy胜出
3 网易有道Confucius4双榜第一:R2T2语音识别与T3PO实时翻译模型开源
4 GPT-6 Sol实测:价格大幅下降但编码能力倒退,性价比成最大亮点
5 CLM-8B对比决策模型发布:延迟仅为Jev的九分之一,刷新SOTA
6 腾讯混元智囊团HyExpert上线:用行业专家知识优化大模型,兼职也能赚钱
7 Claude发现新型逆转录酶系统ART:AI Agent走进基础生物学未知地带
8 WorkBuddy登顶中国企业级桌面智能体第一:生态、安全、可控是三大关键优势
9 腾讯 WorkBuddy 月活破 2000 万背后:办公智能体的商业化难题与破局路径
10 热点模型性能测评:Jev、DeepSeek v4.1 flash 与 GLM 5.3 flashx 对比
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联