10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

Agent会越用越聪明吗?LIFT开源框架量化自我进化能力

38分钟前 AI开源项目 0 0

上个月团队做了一件事:给内部的 Agent Runtime 加了一套 Memory + Skill 沉淀机制,然后跟老板说「以后这个 Agent 会越用越聪明」。老板问了一个问题,让全桌鸦雀无声——怎么证明?你说它进化了,但拿不出一张成绩单。跑过几次任务、写了几页 log、存了几段记忆——这些东西到底有没有让 Agent 下次干活更利落?是快了?还是反而变慢了?还是没变化?

过去一年,几乎所有严肃的 Agent 框架都在往「自我进化」方向卷:Memory、Skill 自动沉淀、Reflection 反思、自改写 Prompt、甚至自动重构自身 DAG。但有一个共同的缺口——没人知道这些机制到底有没有用、用了多少。

主流的 Agent Benchmark 都在测「Agent 初始有多强」:GAIA 测真实世界任务、ClawBench 测浏览器操作、MMLU 测知识推理。这些榜单回答的是「Agent 能不能」,而不是「Agent 能不能越来越能」。直到发现了 LIFT 这个项目。

LIFT项目

01 什么是 LIFT

LIFT 是一套专门面向 Agent 自我进化能力的开源评测框架,来自 Infja 团队。项目地址在 github.com/FeiZhuNiU-INFJA/LIFT。

核心定位一句话就能说清:传统 Benchmark 测 Agent 有多强,LIFT 开始测 Agent 能不能变强。它不评测 Agent 本身的开箱能力——数学、代码、推理交给 GAIA、ClawBench 们。LIFT 只关心一个朴素问题:Agent 做完练习题、跑过一轮记忆沉淀之后,同一套期末考题,它比进化之前考得好吗?好多少?

02 一个被普遍误解的概念

很多人以为给 Agent 加个 Memory 就是 Self-Evolution,其实不是。「记住过去的信息」和「学会过去的经验」是两回事。前者只是存储,后者才是真正的进化。

举个例子:Agent 做了一道题,把题目和答案存进向量数据库,下次遇到类似题能检索到——这是 Memory。而真正的 Self-Evolution 是:Agent 做完题后反思解题过程中的冗余步骤,提炼出一个 Skill,下次再遇到同类题直接调用 Skill,用更少的对话轮数和工具调用完成。LIFT 量化的是后者——进化带来的边际收益。

03 LIFT 怎么测

整个评测分三组任务:

  • Warmup Tasks(练习题)——让 Agent 先跑一批题,触发进化机制(写 Memory、沉淀 Skill、做 Reflection)
  • Holdout Tasks(期末考)——同一组考题跑两遍:Baseline(干净环境,零进化产物)vs Evolved(加载进化产物后)

然后把两组成绩摆在一起看差距。关键设计:Warmup 共用一个容器保证状态连续,每道 Holdout 起新容器防止污染,进化产物以 Docker 镜像形式落地确保对照对称。

04 评测数据长什么样

LIFT 的 Benchmark 数据集设计精细,人能直接读,机器也能直接跑。按三层结构分层:总数据集 -> 场景数据集(Suite)-> 训练/测试任务。

每个任务包含三个元素:query(模拟用户第一次开口,刻意保持口语化和不完整)、要求(真正的验收清单,至少 12 条,每条可独立验证)、轨迹要求(约束 Agent 用什么方法完成任务,而不只是"完成了就行")。

测试集与训练集有 75% 的要求重合度,剩下 25% 是变体或矛盾——检验 Agent 是否能灵活迁移经验,而不是死记硬背或过拟合。

05 另一个 Agent 扮演用户

LIFT 最精巧的设计是不用一次性 pass/fail 来判 Agent,而是用另一个 LLM 来模拟真实的人机交互过程。LLM Judge 只发 query(不透露要求),Agent 执行任务产出文件后,Judge 用所有「要求」逐条检查。全通过则成功,有未过的则以自然口吻反馈,进入修正循环。

为什么 Judge 只披露前两条未完成的要求?因为一次把所有要求都告诉 Agent 等于给了"标准答案"。真实用户的反馈是渐进式的,这迫使 Agent 在"理解需求 -> 产出 -> 接收反馈 -> 迭代"的循环里工作。

06 仪表盘 + 在线排行榜

LIFT 用四个「越低越好」的效率指标来衡量进化收益:Delta Turns%(对话轮数变化率)、Delta Tools%(工具调用次数变化率)、Delta Tokens%(Token 消耗变化率)、Delta Latency%(延迟变化率)。负数表示变好,正数表示变差。

LIFT排行榜

目前排行榜已收录 11 个不同的 Agent Runtime,用 10 次重复试验确保统计显著性。数据表明:

Hermes 系列领跑,三种配置的 Delta Turns% 都稳定在 -17% 到 -19% 之间,95% 置信区间完全在零以下——进化是可复现、统计显著的。裸奔的 OpenClaw(无进化机制)反而略微变慢(+2.74%)。逐题蒸馏这种进化方式效果最好,比事后反思和仅累积 Memory 都强。

07 跑得快也跑得稳

LIFT 默认用 3 repeats x 14 suites x 6 holdouts 的矩阵跑评测,holdout 阶段峰值有 36 个 Docker 容器同时运行。通过 Cell 级隔离 + 自动重试、容器端口随机化、资源闸门等机制保证稳定性。

08 技术架构

整个评测流程完全跑在 Docker 容器里。核心是三类镜像:Base 镜像(干净基础)、Delta 镜像(Warmup 后通过 docker commit 生成的增量镜像)、Evolved 镜像(Base + Delta 叠加后的完整状态)。Baseline 和 Evolved 的唯一变量就是"有没有加载 Delta",任何性能差异都可以归因于进化本身。

所有 Agent 对话、工具调用、Token 消耗都通过 Langfuse 进行全链路 Trace,每一轮对话的 Prompt/Response 都有完整记录。

写在最后

LIFT 的价值不只在于它是一个评测框架,更在于它给了 Agent 行业一个问题的答案——Agent 的竞争,终有一天会从「谁初始能力更强」变成「谁更善于从经验中持续进化」。LIFT 想为这个方向建立一套公开、可复现的评测标准。

Github:https://github.com/FeiZhuNiU-INFJA/LIFT

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:Agent会越用越聪明吗?LIFT开源框架量化自我进化能力
#Agent #LIFT #自我进化 #评测框架 #开源 
收藏 1
微信全面AI化:28个小微入口最全盘点,Personal Agent已来
Hermes Index 排行榜:Claude Opus 5.5 登顶 Agent 性能榜,14 个模型成本差 215 倍
推荐阅读
  • Marketing Skills 开源项目:把营销方法论转化为 AI Agent 可调用技能库
  • PinMe:为 AI 生成的小项目而生的极简部署工具,GitHub 爆火AI前端部署神器
  • Wechatsync 开源工具:自媒体内容一键多平台同步发布指南
  • models.dev 开源项目:AI 模型规格与定价大全,统一口径的比价平台
  • MindPocket:开源AI知识库,让收藏夹变成可全平台同步、自动摘要、智能对话,查询的第二大脑
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
12744 1年前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10877 12月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
10594 9月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
9482 1年前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
9349 9月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
8877 1年前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
8767 12月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
8301 8月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
8172 5月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
8051 8月前

文章目录

关于苏米客
分类排行
1 TalkLikeYou:音频驱动照片开口说话,3090上30+FPS实时数字人
2 dsh-TUI:把DeepSeek Harness搬进终端的开源插件,像素鲸鱼加实时状态栏
3 Easel:浙大北大联合开源的社媒运营 Agent,112 个 Skills 打通小红书抖音B站
4 catbus:统一命令行接口操作 10 大内容平台,小红书抖音B站微博一键调用
5 Agent会越用越聪明吗?LIFT开源框架量化自我进化能力
6 Beszel:26K Star轻量级服务器监控工具,开箱即用
7 API-free:免费AI反代统一面板,五个服务整合一个后台
8 map-motion:基于高德API + Opus的地图路线动效生成工具
9 Wake:开源 Agent 会话管理器,打通 20+ AI 编程助手的记忆孤岛
10 20 个 GitHub Stars 合计近 80 万的 AI Agent Skills:拼出一套完整 Agent Stack
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联