商汤开源SenseNova U1.5-Lite-Preview:8B轻量多模态模型,原生支持4K图像生成
2026年8月3日,商汤科技宣布面向社区开源轻量级统一多模态模型的预览版本SenseNova U1.5-Lite-Preview。这是继今年4月发布SenseNova U1以来,商汤在原生统一多模态路线上的又一次系统性迭代。
SenseNova U1.5-Lite-Preview并非简单的规模升级。它基于NEO-Unify架构,在同一模型中贯通视觉理解、推理、生成与编辑,仅以8B-MoT的轻量级体量,将能力推进到4K分辨率、更精细的真实质感和更复杂的视觉控制层面。
4K原生生成与超长视觉控制
相比前代U1,U1.5在四个方向实现了显著提升:原生支持4K图像生成;更精细的局部纹理、细节与真实世界质感;更准确的中英文文字生成与复杂版式组织;以及更稳定的图像编辑和视觉指令遵循。
在视觉控制方面,U1.5-Lite-Preview重点优化了对长篇自然语言和结构化创作指令的理解能力。官方展示了一个使用1675词超长prompt生成的"背包产品解析"信息图,包含复古博物学风格、五章结构、中英双语对照、拉丁文标注等复杂约束。值得注意的是,模型即使在未高度依赖专门Prompt Enhance格式化数据训练的情况下,仍能稳定执行长篇多约束的视觉指令,体现了原生统一多模态架构从语言描述到视觉结构的原生映射优势。
作为配套,商汤还推出了实验性的Prompt Enhance Skill,可将用户简短的想法自动整理为包含主体、布局、风格、文字和各项约束的完整创作方案。
编辑能力:从单次抽卡到持续迭代
依托原生统一多模态架构,U1.5-Lite-Preview在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程。模型采用encoder-free视觉建模方式,减少了固定视觉编码器带来的信息压缩瓶颈,使得文字笔画、局部纹理、空间结构等精细信息保留得更加完整。
在多项主流评测基准上,U1.5-Lite-Preview显著超越U1:Qwen-Image-Bench从47.14提升至55.20(with Prompt Enhance),ImgEdit-Bench从3.90提升至4.37,GEdit-Bench-en从7.47提升至8.17。官方表示,U1.5以仅8B-MoT的轻量级规模,实现了可比肩商用闭源模型的图像生成与编辑能力。
开源生态与后续规划
SenseNova U1.5-Lite-Preview现已通过GitHub、Hugging Face和魔搭社区面向全球开发者开源。此前U1系列发布以来,已获得包括壁仞科技、寒武纪、昆仑芯、摩尔线程等十余家国产芯片厂商的适配支持。
从U1到U1.5的开源迭代,代表了商汤在统一多模态底层架构上的持续进展。与此同时,面向专业用户的交付级创作模型U1 Pro正进行紧密邀测,将在近期对公众开放服务。