商汤开源SenseNova U1.5-Lite-Preview预览版模型

8月3日 15:34
该基于NEO-unify架构的轻量级模型以8B-MoT规模原生支持4K生成,并已在GitHub、Hugging Face及魔搭社区开放下载。

商汤科技于8月3日正式宣布向社区开源轻量级统一多模态模型的预览版本SenseNova U1.5-Lite-Preview。作为前代产品U1的系统性迭代,该模型基于NEO-unify架构构建,在保持8B-MoT规模的前提下,实现了多项关键能力的升级,旨在推动原生统一多模态技术在真实创作场景中的应用。

在核心性能指标方面,U1.5-Lite-Preview原生支持4K分辨率图像生成,能够呈现更精细的局部纹理、细节与真实世界质感。模型显著优化了对长篇自然语言及结构化视觉指令的理解能力,实现了精准的中英文文字生成与复杂版式组织,解决了以往多模态模型在字体风格、段落间距自动适配及文字与视觉元素对齐方面的痛点。此外,该版本引入了encoder-free视觉建模方式,减少了信息压缩损失,使得图像编辑过程更加可控,支持参考图风格迁移、多参考图组合编辑及交互式精准编辑,用户可通过自然语言指令对画面进行可持续迭代调整,而无需重新采样或导致非编辑区域发生意外变动。

根据官方披露的测试案例,该模型在处理超长提示词场景下表现稳定。例如在生成长卷作品时,模型能够依据数千字的文本描述,将城市景观、工业设施等复杂元素融合于高比例画布中,且放大后建筑纹理与文字标注依然清晰可见。目前在开源平台之外,面向专业用户的交付级创作模型U1 Pro已进入紧密邀测阶段。这一发布标志着商汤在统一多模态领域从基础能力向高精度创作工具的进一步演进,为开发者及设计用户提供了一种低资源消耗、高生成质量的替代方案。