#多模态

多模态 Agent 架构综述:三代感知融合、四域基准与七个开放问题
这篇被 TMLR 接收的 60 页综述,由马里兰大学牵头、联合 KAUST 与牛津大学等十家机构的 16 位作者完成。 它做的事可以概括成一句话:把多模态沿着智能体的每个功能模块系统捋一遍,看它究竟改变了什么,以及为此付出了什么代价。 决定…
微信AI硬核技术开源:WeMM-Embedding 多模态搜索实测
最近几个月微信陆续灰度了很多 AI 功能,现在的微信已经不只是聊天工具,而是搜索 + AI + 聊天三位一体,初步具备了 Agent 的影子。微信 AI 的核心能力之一是对文本、图像、视频做了 RAG 处理,官方也开源了 WeMM-Embe…
不用视频模型也能加字幕:Doubao-Seed-Evolving + ffmpeg 实测教程
分享一个多模态模型的"邪修玩法":不用视频模型,也可以给视频加上炫酷字幕。 字幕效果完全不需要 MiniMax H3 或者 Seedance 系列模型,只需要一个多模态模型(如 doubao-seed-evolving)和 Agent 工具…
豆包coding再升级:doubao-seed-evolving 无限流模式实测
豆包 seed 模型最近推出了一套激进的无限流模式——doubao-seed-evolving,始终使用同一个模型 ID,后台静默更新、自动替换,用户永远拿到的是最新版本。大约每两周更新一次。 对用户来说这是利好&…
doc7:1.1K Star 的开源工具,让 AI 像人一样看懂文档而非识别
今天推荐一个文档转 Markdown 的开源工具 doc7,GitHub 上已收获 1.1K Star。它可以把 PDF、Office、扫描件、截图、图表、公式、流程图等任意文档,通过你自己的多模态模型,转换成 AI 可直接检索、引用和推理…
MiniMax-H3 视频提示词写作教程:T2VA/I2VA/FL2VA/L2VA 四种任务全解析
你兴冲冲打开 MiniMax-H3,输入「一个女孩在雨中奔跑,画面唯美」,点了生成。 等了半分钟,视频出来了。镜头乱晃,女孩的脸走形,没有脚步声,没有雨声,背景音乐像从电梯里偷录的。 你关掉页面,心想:就这? 但问题大概率不在模型,在你的提…
SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线。如今商汤持续强化模型的图像生成与编辑能力,正式开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lit…
腾讯 Miora:AI 原生创意智能体工作室,五大专家 Agent 协同产出图片/视频/3D/UI
腾讯团队开源的 Miora(miora.design,中文名"设计妙境")是一款 AI 原生创意智能体工作室。与 WorkBuddy 同源架构,但定位明确——WorkBuddy 帮你干活,Miora 帮你出图、出视频…
Meta Muse Image 发布:首个 Agent 生图模型,支持写代码查资料和自主修正
Meta 旗下的超智能实验室 Meta Superintelligence Labs 推出了图像生成模型 Muse Image,并同步预览了 Muse Video。Muse Image 的核心创新在于引入了智能体(Agent)机制,不再单纯…
claude-video 开源工具:让 Claude 真正看懂视频的多模态方案
以前想让 Claude 看视频,基本只能靠猜。要么从标题推断,要么拉个字幕文本丢给它,但字幕经常少 90% 的屏幕内容。即使把视频链接给 Claude,它也会说"我不能看视频"。 GitHub 上刚开源的 claude-video(4200…