10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑

1月前 AI开源项目 473 0

今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线。如今商汤持续强化模型的图像生成与编辑能力,正式开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。

U1.5-Lite-Preview 并非简单的模型规模升级,而是基于 U1 的一次系统性迭代。它仅以 8B-MoT 的轻量大小,将能力推进到 4K 分辨率、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。

图片 1

相比 U1 的显著提升

  • 原生支持 4K 图像生成
  • 更精细的局部纹理、细节与真实世界质感
  • 更准确的中英文文字生成与复杂版式组织
  • 更稳定的图像编辑和视觉指令遵循

长上下文视觉控制

U1.5-Lite-Preview 在生成能力上做了系统性打磨。不仅追求 4K 高像素,更关注模型能否理解超长的自然语言和结构化视觉指令,从而实现精准的视觉控制。

更高的视觉控制上限

在海报、信息图、品牌视觉等复杂创作任务中,一张图往往需要同时满足多类要求。U1.5-Lite-Preview 重点优化了对长篇自然语言、结构化创作指令的理解能力。简单需求用几句大白话就能快速生成;复杂任务则可以给出完整详细的创作要求,让模型按明确的视觉结构来执行。

下面这张"背包产品解析"信息图使用了 1675 词的超长 prompt,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束。

图片 2

U1.5-Lite-Preview 的强 prompt following 能力并非主要来自对结构化模板的记忆。即使在未使用专门 Prompt Enhance 格式化数据训练的情况下,模型依然能够稳定执行长篇、多约束、层次化的视觉指令。

为降低编写门槛,还配套了实验性的 Prompt Enhance Skill:能把简短想法自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案。

原生 4K 生成

4K 不只是像素更多,更是对细节、材质、光影和整体一致性的更高要求。无论是自然风光、商业摄影、产品海报、超宽幅长卷,都能呈现真实的材质质感与光影层次。

模型生成了横跨 2018 至 2026 年的 WAIC 发展历程长卷:

图片 3

WAIC 发展历程(分辨率 4K,长宽比 10:3,prompt 总长 3880 words)。即便放大观看,大量文字、图标等设计细节依然清晰稳定。

除了超大画幅,在常规图像的真实感与细节表现上也有明显提升:

图片 4

海岸游客中心建筑概念图

图片 5

浪漫生活主题拼贴海报

图片 6

阳光下的面部特写

图片 7

复古手帐页

图片 8

主题创意海报,人物摄影与夸张字体融合设计

图片 9

渔民坐在船上整理渔网

图片 10

迷你厨师团队正在装饰一只蓝莓奶油

图片 11

夏日冷萃咖啡时尚广告海报

图片 12

女生站在路边,身后车辆穿梭而过

文字生成与版式升级

强化了中英文文字生成及复杂版式组织能力,从杂志内页、旅行攻略,到复杂信息图,都能在保持视觉风格的同时,组织更清晰的版式结构与更准确的文字呈现。

图片 13

杂志内页

图片 14

信息图

图片 15

武康路 Citywalk 攻略

编辑能力进化

图像编辑要求模型能看懂画面内容、理解用户的真实意图,精准判断出"哪里要改、怎么改,以及哪些部分绝对不能动"。

依托原生统一多模态架构,U1.5-Lite-Preview 在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程。同时采用了 encoder-free 视觉建模方式,减少了固定视觉编码器带来的信息压缩与表征瓶颈。

图像创作从一次性的"重新采样",转向可持续迭代的视觉操作过程:模型可以在当前生成结果的基础上持续修改文案、调整版式、补充元素,从"一次抽卡、不行重来"变成"反复修改、改到满意"。

参考图风格与设计再创作

可理解参考图中的配色、构图、材质、字体和视觉语言,将其迁移至新的内容主题;也可以在保留原始信息的基础上,对海报和信息图进行整体美化与设计升级。

输入图片:

图片 16

输出图片:

图片 17

案例:青花瓷风格古建筑屋顶图鉴

多参考图组合编辑

可从多张参考图中分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。

输入图片:

图片 18
图片 19

输出图片:

图片 20

案例:水煮鱼菜单与炸鸡融合

单参考图条件创作

输入图片:

图片 21

输出图片:

图片 22

案例:人物照片简历排版

信息图局部编辑

输入图片:

图片 23

输出图片:

图片 24

案例:替换标题文字

文字编辑

可对真实场景中的文字进行编辑,并保持原有字体、材质、透视、排版与遮挡关系,使文字自然融入原图。

输入图片:

图片 25

输出图片:

图片 26

案例:添加手绘注释

交互式精准编辑

支持区域标记、坐标定位、marker 标记等方式让模型更准确地理解编辑位置与范围。

输入图片:

图片 27

输出图片:

图片 28

案例:红框指定区域修改

从验证架构可行,到真实场景好用

U1.5-Lite-Preview 针对性解决了真实创作痛点,在不盲目扩大模型规模的前提下,对生成与编辑全链路进行系统性优化:

  • 重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练进一步扩展至 4K 分辨率
  • 重新组织了编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力

U1.5-Lite-Preview 在多项主流生成/编辑质量评测基准上显著超越 U1:

  • Qwen-Image-Bench:从 47.14 提升到 55.20(with Prompt Enhance)
  • ImgEdit-Bench:从 3.90 提升到 4.37
  • GEdit-Bench-en:从 7.47 提升到 8.17
  • GEdit-Bench-zh:从 7.42 提升到 8.05

图片 29

图片 30

开源与下载

SenseNova U1.5-Lite-Preview 现面向全球用户开源:

  • GitHub:github.com/OpenSenseNova/SenseNova-U1
  • Hugging Face:huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
  • 魔搭社区:modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview

面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,将在近期对公众开放服务。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
#SenseNova #商汤开源 #多模态模型 #图像生成 #AI图像编辑 
收藏 1
Cherry Studio V2 进阶玩法:Agent 自主执行、MCP 集成与 Skill 生态
Humanizer-zh:专治中文写作 AI 味的开源 Skill,14.6k Star
推荐阅读
  • Prime Agent 开源项目:支持子Agent协作和经验沉淀的自进化编程Agent
  • Karpathy 编程四原则:让 Claude Code 不再瞎改代码的开源技能插件
  • Gander:零权限无广告的 Android 文件查看器,支持 PDF/Office/Markdown
  • Cherry Studio Skill 管理器:从手动配置到一键安装的转变
  • HyperFrames 与 html-video:两个 HTML 生成视频的开源项目对比
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
12379 1年前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10716 11月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
10267 9月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
9188 1年前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
9111 8月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
8678 1年前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
8529 11月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
8064 7月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
7904 5月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
7869 7月前

文章目录

关于苏米客
分类排行
1 VoiceStudio 开源:本地声音克隆工具,3.2 万星支持 646 种语言
2 Diagram Design:AI Agent 驱动的图表设计方案,告别模板式排版
3 page-mascot:网页吉祥物组件,实时追踪鼠标、点击眨眼,52个角色可选
4 腾讯开源BrowserSkill:让AI Agent借用已登录浏览器标签页,2天4K Star
5 1Panel AI 网关:37K Star 开源服务器管理工具开放 AI 网关能力,10 人团队免费
6 M3E Canvas:开源 UI 画布工具,拖拽生成 AI 提示词,7K+ Star
7 research-flow 开源:站在人与 AI 协作平衡点的交互式深度调研 Skill
8 博主万能蒸馏器:一键把任意博主内容转化为本地 AI 知识库
9 Hypit 开源项目:让 AI Agent 自动拆解爆款视频结构,一键生成 100 个变体
10 阿里开源 OpenCodeReview:AI 代码审查工具,Token 成本仅为 Claude Code 的 1/9
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联