#多模态

Jev Visual:前 OpenAI 员工开源决策模型的视觉版,Mac 本地运行多模态判断
这两天最火的话题非 Jev 莫属——参与构建了 RLHF/ChatGPT 的前 OpenAI 员工 Diogo Almeida 的创业公司 TypeSafe 推出了一个决策模型。Jev 是一个低成本、低延迟、高并发的…
HD-V1 视频模型实测:先理解再生成,音画同步与物理规律全面突破
2023 年 9 月写过《两款炸裂 AI 视频神器:Runway & Pika Labs》,之后两年视频模型狂飙突进——可灵、Veo、Seedance、海螺……每家 demo 都好…
多模态 Agent 架构综述:三代感知融合、四域基准与七个开放问题
这篇被 TMLR 接收的 60 页综述,由马里兰大学牵头、联合 KAUST 与牛津大学等十家机构的 16 位作者完成。 它做的事可以概括成一句话:把多模态沿着智能体的每个功能模块系统捋一遍,看它究竟改变了什么,以及为此付出了什么代价。 决定…
微信AI硬核技术开源:WeMM-Embedding 多模态搜索实测
最近几个月微信陆续灰度了很多 AI 功能,现在的微信已经不只是聊天工具,而是搜索 + AI + 聊天三位一体,初步具备了 Agent 的影子。微信 AI 的核心能力之一是对文本、图像、视频做了 RAG 处理,官方也开源了 WeMM-Embe…
不用视频模型也能加字幕:Doubao-Seed-Evolving + ffmpeg 实测教程
分享一个多模态模型的"邪修玩法":不用视频模型,也可以给视频加上炫酷字幕。 字幕效果完全不需要 MiniMax H3 或者 Seedance 系列模型,只需要一个多模态模型(如 doubao-seed-evolving)和 Agent 工具…
豆包coding再升级:doubao-seed-evolving 无限流模式实测
豆包 seed 模型最近推出了一套激进的无限流模式——doubao-seed-evolving,始终使用同一个模型 ID,后台静默更新、自动替换,用户永远拿到的是最新版本。大约每两周更新一次。 对用户来说这是利好&…
doc7:1.1K Star 的开源工具,让 AI 像人一样看懂文档而非识别
今天推荐一个文档转 Markdown 的开源工具 doc7,GitHub 上已收获 1.1K Star。它可以把 PDF、Office、扫描件、截图、图表、公式、流程图等任意文档,通过你自己的多模态模型,转换成 AI 可直接检索、引用和推理…
MiniMax-H3 视频提示词写作教程:T2VA/I2VA/FL2VA/L2VA 四种任务全解析
你兴冲冲打开 MiniMax-H3,输入「一个女孩在雨中奔跑,画面唯美」,点了生成。 等了半分钟,视频出来了。镜头乱晃,女孩的脸走形,没有脚步声,没有雨声,背景音乐像从电梯里偷录的。 你关掉页面,心想:就这? 但问题大概率不在模型,在你的提…
SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线。如今商汤持续强化模型的图像生成与编辑能力,正式开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lit…
腾讯 Miora:AI 原生创意智能体工作室,五大专家 Agent 协同产出图片/视频/3D/UI
腾讯团队开源的 Miora(miora.design,中文名"设计妙境")是一款 AI 原生创意智能体工作室。与 WorkBuddy 同源架构,但定位明确——WorkBuddy 帮你干活,Miora 帮你出图、出视频…