vision banana 在 cityscapes 语义分割任务上以 0.699 miou 超越 sam3 4.7 个百分点,其核心是将分割重构为指令驱动的 rgb 可视化图生成任务,无需重设分割头,通过颜色编码与查表实现标准标签解码。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Vision Banana 在 Cityscapes 语义分割任务上展现出突破性表现,其核心不在于重新设计分割头,而是将分割重构为“按指令生成可视化图”的过程。它绕开了传统判别式模型的结构限制,在保持原生图像生成能力的同时,直接输出可用于解码的 RGB 标注图。
Cityscapes 数据集的关键适配点
Cityscapes 提供 5000 张精细标注图像(2975 训练 / 500 验证 / 1525 测试),标注覆盖 19 类常用城市道路对象。Vision Banana 并未使用原始 34 类标签,而是沿用标准的 _labelTrainIds.png 映射——将道路、人行道、汽车、行人等关键类别保留,合并如“wall”“fence”等低频类,最终统一映射到 19 类 ID 空间。该映射与 mIoU 评估严格对齐,确保结果可比。
如何把分割变成“画图”任务
模型接收一张 Cityscapes 原图 + 自然语言指令,例如:
- “把所有道路区域涂成 RGB(128, 64, 128)”
- “用纯绿色(0, 255, 0)标出所有自行车”
- “将背景设为黑色,其余物体按类别用不同颜色填充”
输出是一张 RGB 图像,每个像素值对应一个预定义颜色编码。训练时,系统自动将这些颜色反查为类别 ID;推理后,只需查表即可还原为标准 _labelsIds.png 格式,直接送入 Cityscapes 官方评估脚本。
Veo 3.1增强了音频生成能力、提示词理解能力和角色一致性控制。支持多参考图生成、场景扩展(Scene Extension)、更长视频制作以及更精准的镜头控制,同时提升了画面真实感和叙事能力。是当前 Google 主推的旗舰视频生成模型。
Vision Banana 的实测性能与对比
在 Cityscapes val 集上,Vision Banana 达到 0.699 mIoU,比当前行业标杆 SAM3 高出 4.7 个百分点。这一结果基于统一模型、零额外分割头、无多任务联合训练——仅靠指令微调完成。值得注意的是:
- 它在“道路”“建筑”“天空”等大区域类别上提升显著,得益于生成建模对全局结构的强约束
- 对小目标如“交通灯”“杆子”的召回略低于专用检测增强模型,但已优于多数纯生成基线
- 推理时无需修改模型权重,仅变换 prompt 和后处理逻辑,切换任务成本极低
实际部署中的注意事项
尽管效果突出,落地时需关注三点:
- 输入图像需保持原始分辨率(2048×1024)或做等比缩放,避免插值导致颜色编码偏移
- 指令中指定的颜色必须严格符合 Cityscapes 官方 color map(如道路=128/64/128),否则解码失败
- 目前不支持实例级区分(如区分两辆相邻汽车),因输出为语义图而非 instanceId 图;若需实例分割,需额外引入轻量聚类后处理
这种“生成即理解”的路径,正推动 Cityscapes 评测从模块化 benchmark 向统一接口 benchmark 演进。










