该模型于6月12日发布,专为绘本、多页PPT及教程等长序列内容创作优化,解决角色风格漂移与图文脱节问题,支持直接生成完整排版的多页演示文稿。
商汤科技于6月12日宣布开源SenseNova U1系列的新成员U1-8B-MoT-Interleaved,这是一款针对图文交错生成场景进行专项强化的多模态模型。该发布旨在解决传统模型在连续创作中面临的叙事断裂、角色形象不一致以及图文语义不对齐等核心问题,使AI能够从生成单张高质量图片转向输出风格统一且逻辑连贯的多页内容序列。
该模型在四个关键维度实现了技术升级。首先,在叙事与角色一致性方面,系统通过强化训练,确保人物形象、画风及故事线在多轮次生成长周期任务中保持高度统一,有效规避了多页创作中常见的角色“跑偏”现象。其次,图文对应能力得到显著增强,模型能够更精准地理解文本描述中的复杂场景、动态动作及空间关系,大幅降低画面内容与文字指令之间的语义偏差。第三,视觉质量方面针对人物结构、文字渲染细节及页面排版进行了定向优化,减少了生成结果中的视觉瑕疵。最后,该版本新增了多页PPT自动生成能力,模型可自动提取输入内容的核心要点,独立完成排版设计与文字渲染工作。
SenseNova U1-8B-MoT-Interleaved主要面向需要创作绘本、故事书、图文教程及演示文稿的用户群体。其开源地址已公布在Hugging Face平台,供开发者下载与使用。此次更新标志着商汤日日新系列在多模态长序列生成领域的进一步深入,通过提供结构化的连贯内容生成能力,试图在垂直应用场景中提升多模态AI的实用性与落地效率,为行业提供了从单点生成功能向全流程连续创作方案转变的技术路径。