10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI学习教程

多模态 Agent 架构综述:三代感知融合、四域基准与七个开放问题

5小时前 AI学习教程 35 0

这篇被 TMLR 接收的 60 页综述,由马里兰大学牵头、联合 KAUST 与牛津大学等十家机构的 16 位作者完成。

它做的事可以概括成一句话:把多模态沿着智能体的每个功能模块系统捋一遍,看它究竟改变了什么,以及为此付出了什么代价。

决定一个智能体能力上限的,往往不是骨干模型的参数量,而是感知与推理之间那道信息瓶颈被压缩掉了多少。

多模态Agent架构

论文信息

标题 A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks
arXiv 2608.20379v1,2026 年 6 月
状态 已被 TMLR 接收,正文 60 页
作者 16 人,马里兰大学为主,联合 KAUST、牛津大学、新加坡国立大学等

研究动机

现有 LLM Agent 综述大多默认分析对象为文本 Agent,多模态要么被简化为一个外接视觉编码器,要么整体略过。本文设定了三个目标:沿感知、推理、规划、记忆、行动五个功能模块逐一分析多模态带来的改变;建立以模态为中心的分类体系;除能力外,量化性能、效率、可扩展性、延迟、可靠性五个维度的代价。

第三点是本文与同类综述的主要差异。多数综述只做能力排名,本文额外量化了部署代价。

基础架构:三组件

组件 功能 现代实现
Perception 将原始多模态输入转换为接地表征 CNN、跨注意力机制、原生多模态处理
Orchestrator 推理、规划、记忆管理 基础模型
Action 执行决策并接收环境反馈 工具调用、UI 导航、代码执行、具身控制

三代感知融合策略

第一代:委托感知(Delegated Perception)

文本 LLM 作为控制器,编排现成的视觉或音频专家模型,将非文本模态转换为 caption、bounding box 或 transcript 后回传 LLM。代表工作包括 HuggingGPP、Visual ChatGPT、MM-ReAct、VisProg。核心缺陷是多模态输入向文本表示转换过程中的信息损失。

第二代:晚期融合(Late-Fusion)

采用冻结编码器提取特征,经可训练投影层映射至 LLM 嵌入空间。Flamingo 的 Perceiver Resampler 是该范式的奠基工作。该范式的关键工程优势在于开源、可本地部署、可蒸馏为小规模模型。

第三代:早期融合(Early-Fusion)

采用统一架构,将文本、像素块、音频波 token 化至统一词表,通过共享自注意力层实现原生跨模态注意力。代表工作包括 GPT-4o、Gemini 1.5、Chameleon、Fuyu-8B、Janus-Pro。

四域基准表现

机器人与物理具身

RT-2 将机器人动作与视觉—语言 token 联合 token 化,新物体任务成功率 62%,相较 RT-1 的 32% 提升 30 个百分点。OpenVLA 是该路线的代表性结果:7B 参数、97 万条机器人演示,跨 29 项评估任务的绝对成功率比 55B 的 RT-2-X 高 16.5 个百分点。π0 系列以连续流匹配替代离散动作 token 化,从 3B 骨干实现 50 Hz 控制频率,相较 RT-2 的 1 至 3 Hz 提升一个数量级。

架构整合比参数规模更重要。

GUI 与 Web 导航

WebArena 上 GPT-4 系智能体成功率 14.41%,人类为 78.24%。VisualWebArena 上 GPT-4V 结合 SoM 表示为 16.4%,人类为 88.7%。60 至 70 个百分点的差距横跨全部融合策略,论文将其归因于三个未解问题:像素级坐标接地、多步规划、错误恢复。

近期工作中,UI-TARS-2 通过多轮强化学习与数据飞轮在 OSWorld 上达 47.5%;Agent S2 采用架构分解,将接地委托给专用视觉模块、规划交给通用推理器,相对单体基线提升 32.7%。

长视频理解与检索

核心矛盾在于:小时级视频遇上注意力的二次复杂度,上下文窗口被数千帧耗尽。解法不是全序列编码,而是将视频视为可供探索的环境。VideoMind 以 Chain-of-LoRA 将各角色实现为 Qwen2-VL 骨干上的轻量 adapter,2B 参数模型性能超过 78B 参数模型。VLog 采用生成式检索,124M 参数模型性能与 LLaMA-2-7B 持平。

长视频理解的瓶颈在于推理与检索策略而非视觉编码容量。

多媒体内容生成与编辑

GenArtist 以 GPT-4V 感知生成结果并通过规划树执行自我纠错,可检测文本系统无法识别的属性绑定失败与空间关系错误,在 T2I-CompBench 上相较 DALL·E 3 提升逾 20%。该域的评估困境:缺乏真实多轮编辑样本与 ground truth,MagicBrush 几乎是唯一的大规模多轮编辑基准。

部署代价的四个维度

效率:OpenVLA 的 7B 模型配合 4-bit 量化在单张消费级 GPU 上达到约 6 Hz 吞吐;RT-2 的 55B 模型需多 TPU 云推理才能维持 1 至 3 Hz 控制频率;π0 达 50 Hz。CogAgent 使高分辨率图像处理的 FLOPs 随视觉特征线性而非二次增长,计算量降至约二十五分之一。

可扩展性:承担前期基础设施投入,比长期依赖每次调用均计费的重型专有 API 更可持续。

延迟:密集视觉验证提升错误恢复能力,但将控制频率压至不适用于真实操作的区间。速度与可靠性在当前框架下相互制约。

可靠性:新方向是从事后验证转向事前预演,Code2World 通过生成可渲染代码模拟下一界面状态,使候选动作可在执行前被评估。

七个开放问题

  1. 复杂环境中的接地鸿沟:GUI 域存在 60 至 70 个百分点的性能差距
  2. 性能与效率的权衡未解:尚无单一架构能同时达到 SOTA 性能与部署可行性
  3. 长程记忆与推理的脆弱性:误差累积、信念修正与状态一致性维护均未解决
  4. 结果不可验证与基准污染:大量 SOTA 结果建立在闭源 API 之上,无法独立复现
  5. 对抗鲁棒性缺失:多模态输入扩大了攻击面
  6. 安全关键失效模式:智能体易被无关或虚假视觉特征干扰
  7. 多模态接地与推理中的幻觉:即便感知准确,推理骨干仍可能幻觉出物理可供性

五个未来方向

  • 统一多模态表征与推理:构建面向下游规划与控制显式优化的表征空间
  • 面向终身学习的可扩展记忆架构:从 RAG 演进到能对自身知识状态进行推理的记忆系统
  • 用于化解权衡的混合架构:分层系统、蒸馏框架、MoE 设计
  • 超越视觉—语言的模态扩展:触觉与力觉、3D 空间推理、跨模态消歧均尚缺乏系统研究
  • 多智能体间的原生多模态通信协议:探索潜在空间通信、统一视觉编解码器

写在最后

论文将「架构整合比参数规模更重要」作为核心结论,OpenVLA 7B 优于 55B、VideoMind 2B 优于 78B、VLog 124M 与 7B 持平三组数据均支持该判断。

但细看这三组对比,胜出方同时也是在目标域数据上专门微调过的一方。因此起决定作用的究竟是架构整合,还是领域特化?若为后者,该结论的成立条件需重新界定。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:多模态 Agent 架构综述:三代感知融合、四域基准与七个开放问题
#多模态 #Agent架构 #TMLR综述 #感知融合 #具身智能 
收藏 1
Archify:8K Star 开源工具,一句话让 AI 生成可追溯源码的架构图
GPT-6 Astra上手指南:4步快速上手流程与可复用提示词模板
推荐阅读
  • DeepSeek 接入 Codex 完整教程:免登录使用第三方 API 的配置指南
  • 手把手教你零基础Mac+OpenCode部署教程,如何用免费模型白嫖顶级 Agent 体验
  • OpenClaw + Claude Code 实战:从 PRD 到代码的 AI 原生研发流水线搭建指南
  • Holo 3.1 本地部署指南:免费搭建 AI Agent,数据不出本地
  • 手把手教你入门iFlow CLI,心流开发平台实战指南
评论 (0)
请登录后发表评论
分类精选
Cursor永久免费攻略:无限邮箱注册+重置机器码+Cursor试用期重置工具实现永久免费使用
51362 1年前
手把手教你如何使用扣子Coze搭建“文生图” AI Bot
22318 2年前
n8n新手入门指南:5 分钟本地部署 + 中文汉化 + 快速启动,玩转工作流(Docker版)
20567 1年前
安装字节Trae登录提示App Unavailable(应用程序不可用)解决办法,这份官方指南请收好!
19849 1年前
手把手教你用国内VISA信用卡直接订阅ChatGPT、Claude、Google Gemini等海外AI服务
19270 7月前
零基础上手 VSCode + Claude Code + GLM-4.6 保姆级安装配置教程
18540 11月前
AI 概念篇:Token是什么?一文讲清楚Token分词、窗口、计费与常用计算工具
18050 8月前
Gemini CLI 装好了,登录异常怎么办?手把手教你解决 Gemini CLI 登录问题
17877 1年前
一文搞懂什么是 Vibe Coding?Vibe Coding工具推荐及Cursor编程开发实践
16403 1年前
手把手教你使用 Gemini 2.5 Pro 免费 API搭建本地知识库,一键接入 Gemini!
15901 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 GPT-6 Astra上手指南:4步快速上手流程与可复用提示词模板
2 多模态 Agent 架构综述:三代感知融合、四域基准与七个开放问题
3 WorkDaddy插件:给WorkBuddy装上多账号切换、自动签到和无人值守功能
4 Pi Web部署实操体验教程,Pi CLI 的可视化网页界面,让 AI 编程更直观
5 Grok Bot 保姆级教程:AI 执行型助手全解析,从会员升级到创建你的第一个 AI 队友
6 豆包电脑版实测:从聊天到 AI 工作台,文件整理/报销/PPT 生成全流程体验
7 不用视频模型也能加字幕:Doubao-Seed-Evolving + ffmpeg 实测教程
8 豆包工作8个技巧:飞书Agent实测指南
9 小红书图文自动排版Skill教程:基于IP的专属排版工厂
10 Seedance 2.5 + 世界模型:告别反复抽卡的 AI 视频制作新方法
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联