商汤科技正式向社区开源轻量级统一多模态模型 sensenova u1.5-lite-preview。该模型并非单纯追求参数量增长,而是基于 sensenova u1 的深度演进,在统一架构内深度融合视觉理解、推理、生成与编辑四大核心能力。
尤为突出的是其极致轻量化设计——仅采用 8B-MoE 参数规模,即实现对 4K 分辨率图像的高质量生成、更逼真的物理质感还原,以及更精准的细粒度视觉控制。商汤指出,若 U1 验证了统一架构的技术可行性,那么 U1.5 则致力于探索该架构在能力维度上的可持续扩展边界。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

四大能力全面跃升,生成与编辑实现端到端增强
相较于 U1,U1.5-Lite-Preview 在以下四个关键维度实现显著突破:原生支持 4K 级图像生成;局部纹理刻画更细腻,真实世界材质表现更自然;中英文文字生成准确性更高,复杂图文排版逻辑更严谨;图像编辑过程更鲁棒,对视觉指令的理解与执行更可靠。
在技术实现层面,为应对网格伪影及高分辨率细节建模难题,商汤重构了生成头结构,有效削弱视觉 Token 网格化带来的图像失真,并将训练分辨率提升至 4K。在图像编辑方向,模型重新构建编辑数据分布与任务范式,重点强化对原始图像内容一致性、主体身份稳定性、空间几何结构完整性以及非编辑区域保真度的建模能力,确保修改目标区域的同时,最大程度保留无需调整的原始信息。
多项权威评测大幅领先,编辑性能优势显著
实测数据印证了此次升级的实际成效:Qwen-Image-Bench 得分由 47.14 提升至 55.20(启用提示词优化策略),ImgEdit-Bench 从 3.90 升至 4.37,GEdit-Bench 英文版由 7.47 增至 8.17,中文版亦从 7.42 提升至 8.05。整体来看,图像生成质量与编辑过程稳定性均取得实质性进步,尤其在指令精准响应与原图结构保持方面表现亮眼。
商汤强调,U1.5-Lite-Preview 的研发哲学在于拒绝盲目堆叠参数,转而聚焦于生成与编辑全流程的系统性精调。这种“以架构革新驱动能力进化”的路径,为轻量级多模态模型的长期演进提供了极具参考价值的实践样本——当仅需 8B 参数即可稳定支撑 4K 图像生成与高保真编辑,统一多模态架构所蕴藏的技术潜力,或许才真正拉开序幕。











