商汤开源8B多模态大模型U1.5 Lite

8月21日 12:20
商汤于8月21日向开发者与创作者开放该项目,说明其采用8B参数的轻量化原生统一架构,提供3至4K上下文、原生4K输出及区域级编辑控制,面向视觉生成、图像编辑与复杂排版场景。

商汤科技于8月21日宣布将其轻量级原生统一多模态大模型 SenseNova U1.5 Lite 以开源方式提供给开发者与创作者。该版本参数规模为8B,面向图像生成、图像编辑与复杂视觉排版任务,并提供3至4K上下文长度、原生4K分辨率输出,以及对主体、数量、空间关系、文字、布局和风格等多类约束的共同处理。

生成流程中,模型优化构图、颜色、材质、光影、真实感和局部细节,以降低局部片段可用但整幅画面不够完整的概率。编辑流程中,模型限制对未选区域的改动,以保持主体一致性、空间层次和版式关系;局部修补、元素替换、文字细节修正以及基于多个参考图的合成也被纳入功能范围。控制方式包括Bounding Box、Visual Marker、单图参考与多图参考,可针对指定区域或对象执行调整。

公开技术文档显示,研发过程围绕真实场景中的视觉任务调整训练数据体系、任务设计和后训练流程,重点方向包括视觉质量、复杂指令响应、文字与布局处理。官方称该模型在指令遵循与图像编辑保持度上超过同规模模型,在文字渲染与复杂布局上达到媲美超大规模商业模型的交付水平。该模型已在GitHub、Hugging Face和魔搭社区开放,可用于广告素材、电商展示、中英文海报、信息图和品牌视觉等内容制作环节。