商汤科技近日宣布,面向全球用户开源轻量级统一多模态模型预览版本SenseNova U1.5-Lite-Preview。这一版本基于此前发布的SenseNova U1架构进行系统性升级,在保持仅8B-MoT参数规模的同时,实现了4K分辨率图像生成、更精细的视觉质感表现以及更复杂的视觉控制能力,标志着多模态模型向实用化方向迈出重要一步。
该模型的核心突破在于将视觉理解、推理、生成与编辑功能整合至统一架构中。相较于传统模型依赖外挂式编辑模块的设计,U1.5-Lite-Preview通过原生架构实现了图像编辑能力的深度融合。用户可直接通过自然语言指令完成参考图风格迁移、多图组合编辑、信息图局部修改等复杂操作,编辑过程支持持续迭代优化,而非传统的一次性生成模式。
在技术实现层面,模型重点强化了长文本理解能力。通过优化对结构化创作指令的解析机制,用户既可用简短语句快速生成图像,也能通过详细描述实现精确控制。商汤研发团队特别指出,这种能力并非源于对特定提示词模板的记忆训练,而是模型自主建立了语言描述与视觉结构之间的原生映射关系,即使在未使用专门格式化数据训练的情况下,仍能稳定执行多层次视觉指令。
文字生成能力是此次升级的另一亮点。模型可准确处理中英文混合文本,支持复杂版式设计,包括多字体组合、艺术字渲染及文字与背景的融合处理。在视觉控制方面,新版本引入更精细的局部纹理生成机制,能够模拟真实世界的材质表现,如金属光泽、织物纹理等细节特征。
从技术演进路径看,商汤今年4月发布的SenseNova U1首次验证了原生统一多模态架构的可行性,7月推出的信息图增强版V3则拓展了专业应用场景。此次开源的U1.5-Lite-Preview进一步证明,统一架构不仅可同时承载理解与生成任务,还能持续扩展至更高分辨率、更复杂的信息表达领域。该模型目前已覆盖参考图再创作、多图编辑、条件创作、信息图修改等六大主流创作工作流。
据内部人士透露,面向专业用户的交付级模型SenseNova U1 Pro已完成内部测试,其长程任务处理能力可支持从需求理解到最终交付的完整闭环。该版本预计将于近期开放公众服务,届时将推动行业从"单点内容生成"向"系统级内容交付"转型。










