商汤发布并开源SenseNova-Vision统一视觉大模型

7月13日 12:38
该模型作为日日新体系视觉能力升级核心,通过原生融合机制覆盖结构化理解、稠密几何预测等四大任务,同步释放5000万条样本语料库。

商汤科技于7月13日正式推出并全面开源“日日新SenseNova-Vision”理解生成统一视觉大模型。该动作标志着商汤在视觉基础模型领域的技术架构发生根本性变革,旨在解决传统方案中多专家模型拼接导致的割裂问题。SenseNova-Vision 将视觉能力作为原生模块深度集成至大模型体系,不再依赖外部封装,从而实现目标检测、图像分割、深度预测及3D重建等经典任务的单模型统一处理。

在性能表现上,该模型在四大核心视觉领域展现出显著的通用性优势。结构化视觉理解方面,其在目标检测、指代检测、OCR识别及关键点定位等任务中全面领先同类通用模型,特别是在处理稠密小目标检测与长尾类别识别时保持稳定输出。稠密几何预测领域,SenseNova-Vision 的深度估计与表面法向估计精度已逼近专业几何模型水准,适用于室内外多种复杂场景。分割能力方面,依托多模态理解力,该模型在推理分割与对话式分割任务中表现优异,涵盖通用、交互式等多种细分类型。此外,仅凭单一模型即可完成高质量的多视角点云重建与相机位姿估计,性能指标在通用视觉路线中处于领先地位。

横向对比显示,SenseNova-Vision 在与语义导向模型(如 Youtu-VL)的评测中,于细节要求极高的检测、分割及深度任务上实现全面超越;相较于生成导向模型 Vision Banana,则展现出代际优势。Vision Banana 仅能应对四大核心板块中的两类问题,而 SenseNova-Vision 能够同时覆盖结构化理解、稠密几何、全景分割及多视角3D等全任务谱系。除模型权重外,商汤同步开源了包含5000万条样本的视觉指令语料库 SenseNova-Vision Corpus-50M。根据规划,未来该模型的核心技术将全面融入日日新 U 系列大产品体系中,推动行业视觉解决方案向原生统一架构演进。