lance 是字节跳动智能创作团队推出的开源轻量级原生多模态统一模型,仅含 3b 激活参数,可在单一封装框架中无缝支持图像与视频的理解、生成及编辑全流程任务。该模型采用分阶段多任务训练策略从零构建,全程仅需 128 张 a100 gpu,已在 geneval、vbench 等权威基准测试中取得领先表现,并遵循 apache-2.0 开源协议,允许商用、二次开发与自由分发。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Lance 的核心能力
- 图像理解:实现细粒度语义解析、物体识别、场景理解与视觉问答(VQA)。
- 图像生成:依据文本指令生成高保真图像,支持多对象布局、属性精准控制与风格一致性建模。
- 图像编辑:提供指令驱动的编辑能力,涵盖背景重置、目标增删、跨域风格迁移与外观精细化调整。
- 视频理解:完成帧间时序建模、动作语义识别、事件定位与动态场景推理。
- 视频生成:基于自然语言描述生成逻辑连贯、运动自然的短视频,兼顾角色行为与环境演化。
- 视频编辑:支持单步修改(如替换主体)与复合操作(如同步更新背景+动作+光照),保持时空一致性。
- 多轮一致性编辑:对同一视觉主体执行多次迭代编辑,稳定维持身份特征、姿态逻辑与视觉风格。
Lance 的技术架构
- 双流混合专家(MoE)设计:共享底层多模态表征主干,为理解与生成任务分别配置专属专家子网络,降低任务冲突,提升泛化效率。
- 统一交织序列建模:将文本 token、ViT 提取的视觉语义 token、干净 VAE 潜在表示与加噪 VAE 潜在表示整合为单一长序列,统一支撑理解、生成与条件编辑三类范式。
- 广义三维因果注意力机制:按模态划分序列段,文本部分启用标准因果掩码,视觉部分采用全向注意力,实现跨模态联合建模与解耦式推理。
- 模态感知旋转位置编码(RoPE):针对图像 patch、视频体素及文本符号等异构 token 类型,定制差异化位置嵌入方案,缓解模态混叠干扰。
- 渐进式分阶段训练流程:依次开展大规模多模态预训练、面向生成/编辑的持续训练、以及高质量监督微调,在有限算力约束下达成多任务协同优化。
如何快速上手 Lance
- 运行环境:需 Python 3.9+ 环境及至少一块 CUDA 兼容 GPU(推荐 ≥24GB 显存)。
-
获取代码:执行
git clone https://www.php.cn/link/467c89d5b3e204eebe33ddbc54d905b1.git拉取官方项目仓库。 -
安装依赖:进入项目根目录后运行
pip install -r requirements.txt完成基础库部署。 - 加载权重:从 Hugging Face Hub 或 GitHub Release 页面下载预训练模型 checkpoint。
-
启动推理:参考
examples/中提供的脚本,传入文本提示或图像/视频输入,即可执行理解、生成或编辑任务。
Lance 的突出优势
- 超轻量化设计:3B 激活参数规模,在统一多模态模型中实现性能与资源消耗的最优权衡。
- 全栈一体化能力:单模型覆盖图像/视频六大任务(理解、生成、编辑),无需切换多个专用模型。
- 低门槛可复现性:训练全程可控于 128 张 A100 GPU,显著降低学术研究与工业落地的算力门槛。
- 开放商用许可:Apache-2.0 协议保障用户可自由用于商业产品、私有部署及功能扩展。
- 综合性能卓越:在 GenEval、GEdit-Bench、VBench 等多项评测中全面超越同规模开源竞品。
Lance 的官方资源入口
- 项目主页:https://www.php.cn/link/c43ec88d1144d98c9392a4648046d7d6
- GitHub 仓库:https://www.php.cn/link/467c89d5b3e204eebe33ddbc54d905b1
- Hugging Face 模型页:https://www.php.cn/link/8c6dbe74136c6b99fdf23260b7b9f02b
- 技术论文(arXiv):https://www.php.cn/link/dedf106cfc8eff602c7231062e1bec0c
Lance 与主流竞品对比
| 对比维度 | Lance | TUNA | Show-o2 |
|---|---|---|---|
| 激活参数量 | 3B | 7B | 7B |
| 任务覆盖 | 图像/视频理解、生成、编辑 | 图像/视频理解、生成 | 图像/视频理解、生成 |
| 开源协议 | Apache-2.0 | 未明确 | Apache-2.0 |
| GenEval 总分 | 0.90 | 0.90 | 0.76 |
| GEdit-Bench 均分 | 7.30 | 6.52 | 未列入 |
| VBench 总分 | 85.11 | 未列入 | 未列入 |
| 架构特点 | 双流 MoE + 模态感知位置编码 | 统一自回归架构 | 统一自回归架构 |
Lance 的典型应用场景
- AI 辅助创意设计:为平面设计师、UI/UX 工作者与新媒体运营人员提供端到端视觉内容生成与精修工具链。
- 短视频工业化生产:赋能 MCN 机构与内容平台实现脚本→画面→剪辑的一站式自动产出,提升产能效率。
- 电商营销素材生成:批量创建商品主图、详情页视觉稿、促销短视频,支撑 A/B 测试与多渠道适配。
- 智能视觉检索系统:结合深度理解能力,增强电商平台、数字资产库与安防系统的跨模态搜索精度。
- 教育可视化内容构建:自动化生成学科示意图、实验演示动画与知识讲解短视频,丰富智慧教学资源体系。











