原生统一多模态进阶!SenseNova U1.5-Lite-Preview开源,生成编辑能力再进化
今年4月,商汤科技发布了SenseNova U1,首次完整展示了基于NEO-Unify架构的原生统一多模态路线:在单一模型中联合建模语言、视觉语义与像素生成,让模型能够原生完成视觉理解、推理和生成。
过去几个月中,我们持续强化模型的图像生成与编辑能力,现面向社区开源轻量级统一多模态模型的预览版本SenseNova U1.5-Lite-Preview。SenseNova U1.5-Lite-Preview并非简单的模型规模升级,而是基于U1的一次系统性迭代,不仅在同一架构中贯通视觉理解、推理、生成与编辑,还仅以 8B-MoT 的轻量大小,将能力推进到4K、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。
SenseNova U1.5-Lite-Preview 生成
相比U1,U1.5-Lite-Preview在以下方向上带来了显著提升:
- 原生支持4K图像生成;
- 更精细的局部纹理、细节与真实世界质感;
- 更准确的中英文文字生成与复杂版式组织;
- 更稳定的图像编辑和视觉指令遵循;
如果说U1成功验证了“统一架构是否可行”,证明了从像素和语言出发、端到端构建原生统一多模态模型是一条可行的路线,那么U1.5将进一步验证“能力能否持续扩展”,证明统一架构不仅能够同时承载理解和生成,也能够继续扩展到更高分辨率、更复杂的信息表达和更真实的视觉世界。
我们相信,未来的多模态模型不应只是连接不同模态的系统,而应该是一个从一开始就能够跨越语言、视觉与行动进行学习、思考和创造的统一智能体。
长上下文视觉控制:模型能力与创作辅助的协同
U1.5-Lite-Preview在生成能力上做了系统性打磨,我们追求的不仅仅只是4K高像素,更关注的是:模型能否理解超长的自然语言和结构化视觉指令,从而实现精准的视觉控制;超大画幅下细节是否经得起放大、并保持足够的真实世界质感;信息密集的内容里文字和版式是否足够稳定。
更高的视觉控制上限:写得越细,出图越准
在海报、信息图、品牌视觉等更复杂的创作任务中,一张图往往需要同时满足多类要求:画面中有哪些主体、人物与物体如何互动、各元素位于什么位置、采用怎样的视觉风格、呈现哪些文字,以及哪些内容必须保持或避免。
U1.5-Lite-Preview重点优化了对长篇自然语言、结构化创作指令的理解能力。简单的需求,用户用几句大白话就能快速生成;复杂的任务,则可以给出完整详细的创作要求,让模型按明确的视觉结构来执行。在我们看来,超长的提示词并不是生成好图的必要条件,它的价值是给复杂创作提供了更高的控制上限。
下面这张“背包产品解析”信息图使用了1675词的超长 prompt,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束。
一个重要观察是,U1.5-Lite-Preview的强prompt following能力,并非主要来自对结构化模板的记忆或适配。即使在没有高度依赖专门Prompt Enhance格式化数据训练的情况下,模型依然能够较稳定地执行长篇、多约束、层次化的视觉指令。我们认为,这正体现了原生统一多模态路线的优势:模型学到的不是某种Prompt格式本身,而是从语言描述到视觉结构的原生映射能力。
为了降低复杂视觉指令的编写门槛,我们还配套了实验性的Prompt Enhance Skill:它能把用户简短的想法,自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案,再交给模型执行,帮助用户把需求表达得更周全,减少因为描述有遗漏导致效果偏差的情况。
原生4K生成:超大画幅下,细节依然经得起放大
4K不只是像素更多,更是对细节、材质、光影和整体一致性的更高要求。无论是自然风光、商业摄影、产品海报、超宽幅长卷与高细节视觉内容,U1.5-Lite-Preview都能呈现真实的材质质感与光影层次。
下面的案例中,模型生成了横跨2018至2026年的WAIC发展历程长卷。
WAIC 发展历程(分辨率4K,长宽比10:3,prompt 总长 3880 words)
这幅长卷以传统中国山水长卷的散点透视和连续叙事方式,将上海城市、智慧交通、云计算、智能工厂、大模型、生成式人工智能、具身机器人、智能体和未来城市融合在同一片山河之中。即便放大观看,大量文字、图标等设计细节依然清晰稳定。
除了超大画幅,U1.5-Lite-Preview在常规图像的真实感与细节表现上也有明显提升:
海岸游客中心建筑概念图
浪漫生活主题拼贴海报 | 阳光下的面部特写 |
复古手帐页 | 主题创意海报,人物摄影与夸张字体融合设计 |
渔民坐在船上整理渔网 | 迷你厨师团队正在装饰一只蓝莓奶油 |
夏日冷萃咖啡时尚广告海报 | 女生站在路边,身后车辆穿梭而过 |
文字生成与版式升级:信息量再大,效果也稳得住
U1.5-Lite-Preview强化了中英文文字生成及复杂版式组织能力,从杂志内页、旅行攻略,到复杂信息图,都能在保持视觉风格的同时,组织更清晰的版式结构与更准确的文字呈现。
杂志内页 | 信息图 |
武康路 Citywalk 攻略
编辑能力进化:告别单次抽卡,哪里不对改哪里
图像编辑并非简单的局部像素重绘,它要求模型能看懂画面内容、理解用户的真实意图,精准判断出 “哪里要改、怎么改,以及哪些部分绝对不能动”。
依托原生统一多模态架构,U1.5-Lite-Preview不需要拼接多个独立模型,在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程。同时采用了encoder-free视觉建模方式,减少了固定视觉编码器带来的信息压缩与表征瓶颈,将文字笔画、局部纹理、空间结构等精细信息保留得更加完整,进一步提升了编辑的准确度、画面稳定性和可控性。
U1.5-Lite-Preview让图像编辑不再是外挂功能,而是统一模型在理解视觉状态、执行用户约束并重构目标画面上的原生能力。这使图像创作从一次性的“重新采样”,转向可持续迭代的视觉操作过程:模型可以在当前生成结果的基础上持续修改文案、调整版式、补充元素,从“一次抽卡、不行重来”变成“反复修改、改到满意”。
目前,U1.5-Lite-Preview已覆盖多类主流创作工作流:
参考图风格与设计再创作:看懂一种风格,迁移到任何主题
可理解参考图中的配色、构图、材质、字体和视觉语言,将其迁移至新的内容主题;也可以在保留原始信息的基础上,对海报和信息图进行整体美化与设计升级。
输入图片 | 输出图片 |
案例:青花瓷风格古建筑屋顶图鉴
多参考图组合编辑:跨图取要素,融合成新作
可从多张参考图中分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。
输入图片 输出图片
案例:餐饮海报定制
单参考图条件创作:以一张图为基础,完成完整视觉设计
能够以单张人物、产品或场景图片作为视觉条件,在保持主体身份、外观和关键细节的基础上,生成新的海报、信息图、营销页面或其他设计内容。
输入图片 | 输出图片 |
案例:人物照片简历排版
信息图局部编辑:牵一发,不动全身
可针对信息图中的标题、数字、图标、标注、图表及内容模块进行定向修改,支持元素增删、位置调整、局部美化和瑕疵修复。
输入图片 | 输出图片 |
案例:替换标题文字
文字编辑:文字改了,风格还在
可对真实场景中的文字进行编辑,并保持原有字体、材质、透视、排版与遮挡关系,使文字自然融入原图。
输入图片 | 输出图片 |
案例:添加手绘注释
交互式精准编辑:画个框,告诉模型“改这里”
支持区域标记、坐标定位、marker标记等方式让模型更准确地理解编辑位置与范围,可对局部属性进行调整。
输入图片 | 输出图片 |
案例:红框指定区域修改
基于U1的系统性迭代:从验证架构可行,到真实场景好用
U1成功验证了原生统一多模态架构的可行性,而在实际落地与社区反馈中,我们也看到了这条技术路线仍有可优化的真实场景痛点:
- 在生成场景下,U1在不同区域之间有时会衔接得不够自然,出现细微的网格感、拼接痕迹或纹理断裂;而当生成分辨率继续提升时,模型对局部细节、复杂空间关系和整体画面一致性的建模难度也会进一步增加。
- 在图像编辑任务中,U1已经能够理解自然语言编辑指令,但在更复杂的实际工作流中,仍可能出现编辑范围外内容发生变化、人物身份或主体结构漂移、局部修改影响整体画面等问题。
U1.5-Lite-Preview致力于针对性解决这些真实创作痛点,在不盲目扩大模型规模的前提下,对生成与编辑全链路进行系统性优化:
- 针对网格伪影和高分辨率细节建模问题,U1.5-Lite-Preview重新设计了生成头,减弱视觉Token网格对最终图像的影响,并将训练进一步扩展至4K分辨率。
- 针对图像编辑,U1.5-Lite-Preview重新组织了编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力,使其能够在完成目标修改的同时,尽可能保留原图中不需要改变的部分。
得益于多项能力强化,U1.5-Lite-Preview在多项主流生成/编辑质量评测基准上显著超越U1,并以仅 8B-MoT 的轻量级规模,实现了可比肩商用闭源模型的图像生成能力与编辑效果:
- Qwen-Image-Bench从47.14提升到了55.20(with Prompt Enhance)
- ImgEdit-Bench从3.90提升到4.37
- GEdit-Bench-en从7.47提升到8.17
- GEdit-Bench-zh从7.42提升到8.05
SenseNova U1.5-Lite-Preview现面向全球用户开源,欢迎广大开发者与创作者下载体验,提供反馈和建议。
- GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
- Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
- 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
从 U1 到 U1.5 的开源,代表了商汤在底层创新上的持续进展。同时,面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,将在近期对公众开放服务。
本文由方向对了资讯网发布,不代表方向对了资讯网立场,转载联系作者并注明出处:https://zhenyes.com/industry/8440.html






