#多模态模型
不用视频模型也能加字幕:Doubao-Seed-Evolving + ffmpeg 实测教程
分享一个多模态模型的"邪修玩法":不用视频模型,也可以给视频加上炫酷字幕。
字幕效果完全不需要 MiniMax H3 或者 Seedance 系列模型,只需要一个多模态模型(如 doubao-seed-evolving)和 Agent 工具…
doc7:1.1K Star 的开源工具,让 AI 像人一样看懂文档而非识别
今天推荐一个文档转 Markdown 的开源工具 doc7,GitHub 上已收获 1.1K Star。它可以把 PDF、Office、扫描件、截图、图表、公式、流程图等任意文档,通过你自己的多模态模型,转换成 AI 可直接检索、引用和推理…
SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线。如今商汤持续强化模型的图像生成与编辑能力,正式开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lit…
Qwen3.7-Plus正式上线:阿里最强多模态智能体模型,限时8折
阿里云百炼平台正式宣布:Qwen3.7-Plus 正式上线。作为千问 3.7 系列的重要成员,Qwen3.7-Plus 被官方定义为"能看、能想、能动手的多模态智能体模型",在编程、办公自动化与长周期任务自主执行方面全面进阶。
Qwen3.…
谷歌开源 Gemma 4 12B:统一无编码器架构,16GB 内存笔记本即可运行多模态模型
谷歌 DeepMind 发布了 Gemma 4 12B 模型。该模型将多模态智能能力集成到轻量级架构中,可在消费级笔记本电脑上运行。
Gemma 4 12B 填补了 Gemma 系列的关键空缺:比边缘端的 E4B 更强,比 26B 混合专…
LongCat-Flash-Omni 正式发布并开源:开启全模态实时交互时代
美团正式发布 LongCat-Flash 系列模型,现已开源 LongCat-Flash-Chat 和 LongCat-Flash-Thinking 两大版本,获得了开发者的关注。
今天 LongCat-Flash 系列再升级,正式发布全新…