10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

CLM-8B对比决策模型发布:延迟仅为Jev的九分之一,刷新SOTA

12小时前 AI最新动态 0 0

CLM(Contrastive Language Model)是一个用对比学习训练的决策模型。它把状态(state)和动作(action)映射到同一个向量空间,用内积算匹配度。给定当前状态和一组候选动作,CLM 给每个动作打分,选最高分。这听起来简单,但效果不简单。

System One 这个词来自卡尼曼的快慢思考。Agent 领域里,大多数决策依赖 LLM 的逐步推理,慢但可靠。CLM 想模仿的是那种"看一眼就知道该怎么做"的直觉反应,官方直接把它叫做 System One 模型。

图片 1

零样本测试覆盖计算机使用、游戏和工具调用。在 T-Rex、BFCL v4、WikiRacing、Super Mario 上,CLM-8B 和 Jev 的表现相当,推理却快得多。候选动作越多,优势越明显。WikiRacing 里动作数量大,CLM-8B 的延迟只有 Jev 的约九分之一。

图片 2

另一个角色是验证器。做法是先采样几个候选答案,然后用 CLM 挑最好的那个。在 38 个 held-out DeepSWE 任务上,轻量微调后的 CLM 达到 81.6%;在 30 个 held-out Terminal-Bench 2.1 任务上达到 87.6%,都刷新了 SOTA。对比之下,Jev 在这类长时任务里连 pass@1 都达不到,当验证器基本失效。CLM 验证时比 Jev 快 4.1-5.7 倍。

图片 3

核心设计是状态和动作的解耦。两个编码器独立,所以动作 embedding 可以缓存复用。实际场景里状态不断变化,候选动作却常常固定。CLM 在服务端做了一个向量缓存,类似 vLLM 的 KV cache 预留显存。命中后不需要过编码器,直接算点积。实测中,20 个房间反复访问的状态,50 个候选动作下服务端 p50 从 2.0ms 降到 0.7ms。

训练分三个阶段。先拿 6000 万 Nemotron DQA 问答对做预训练,再用 3000 万合成 hard negatives 做中间训练,最后用 100 万 agent 轨迹做后训练。中间训练的价值很明确:如果从一开始就加 hard negatives,top-1 只到 62.4%;先预训练再精修,能到 69.2%。Hard negatives 是精修工具,不是预训练的替代品。后训练阶段混入 40% 预训练数据,能防止性能下降。

图片 4

代码和模型已经在 GitHub 和 Hugging Face 上开源。仓库带 playground,可以写状态、加问题,看答案分布。跑起来也不复杂,一个 Qwen3-8B 编码服务,一个 clm-serve 进程。API 支持三种题型:Noul 返回二元概率,Choice 做分类,Score 做评分。另外还有纯 ranking 接口,用来给候选答案排序或做 best-of-N 选择。

值得注意的还有扩展定律。CLM 的测试损失随着训练算力、模型参数和数据量平滑下降,遵循标准的 scaling law。这意味着只要继续投入算力,性能还有提升空间。

CLM-8B 的意义在于:它证明了不靠逐步推理也能做出高质量决策。在需要低延迟、大批量候选动作的场景下(如计算机操作、游戏控制),直觉式决策比推理式决策更实用。当然,它并不能完全替代 LLM——CLM 没有泛化能力,无法处理训练分布外的状态和动作。但在它覆盖的场景里,速度是 LLM 的数倍,成本也低得多。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:CLM-8B对比决策模型发布:延迟仅为Jev的九分之一,刷新SOTA
#CLM-8B #对比学习 #System One #Agent决策 #开源模型 
收藏 1
腾讯混元智囊团HyExpert上线:用行业专家知识优化大模型,兼职也能赚钱
这是最后一篇
推荐阅读
  • 元宝与微信小程序互通:AI助手可直接跳转办事、购物、视频服务
  • Kimi Work 桌面 Agent:支持 300 个 Agent 并行,实现网页数据抓取与分析
  • 纳德拉:未来开发者要管理 1000 个 AI Agent,编程不会死但工作方式会变
  • WorkBuddy 开放平台上线实测:上传第一个 Skill 的完整体验
  • Anthropic 封杀 OpenClaw 事件回顾:13.5 万实例受影响,用户可领补偿额度
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34105 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30719 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23447 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22886 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
21155 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18942 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18558 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18361 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18132 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16575 1年前

文章目录

关于苏米客
分类排行
1 GPT-6 Sol实测:价格大幅下降但编码能力倒退,性价比成最大亮点
2 CLM-8B对比决策模型发布:延迟仅为Jev的九分之一,刷新SOTA
3 腾讯混元智囊团HyExpert上线:用行业专家知识优化大模型,兼职也能赚钱
4 Claude发现新型逆转录酶系统ART:AI Agent走进基础生物学未知地带
5 WorkBuddy登顶中国企业级桌面智能体第一:生态、安全、可控是三大关键优势
6 腾讯 WorkBuddy 月活破 2000 万背后:办公智能体的商业化难题与破局路径
7 热点模型性能测评:Jev、DeepSeek v4.1 flash 与 GLM 5.3 flashx 对比
8 腾讯 WorkBuddy 金融版上线:80+ 专属技能,定制金融行业 AI 工作台
9 阶跃 Step 5 Preview 发布:600B 参数旗舰模型,AGI Bar 限时免费体验
10 Claude Opus 5.5发布:旗舰模型降价20%,缓存读取降价60%
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联