vision banana的指称表达式分割是通过自然语言指令驱动生成模型将目标区域渲染为指定颜色,再依色值提取二值掩码;它不依赖传统分割头,而依靠生成模型对语义与像素的联合建模能力。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Vision Banana 的指称表达式分割,本质是用自然语言告诉模型“把图里哪个东西涂成什么颜色”,再从生成图中提取对应区域。它不依赖传统分割头或训练掩码,靠的是生成模型对语义与像素的联合建模能力。
什么是指称表达式分割
指称表达式分割(Referring Expression Segmentation)是指根据一段描述性文字,精准定位并分割出图像中唯一对应的物体区域。比如输入图中有一只猫、一只狗和一个沙发,Prompt 写“坐在沙发左边的那只橘猫”,模型就要只框出那只猫——不是所有猫,也不是整张沙发。
Vision Banana 把这个任务转成“着色生成”:给定图像 + Prompt,输出一张 RGB 图,其中目标区域被严格渲染为指定颜色(如 ),其余部分为黑色或背景色。后续只需按颜色阈值提取像素,就能得到二值掩码。
如何写有效的指称 Prompt
Prompt 质量直接影响分割精度。Vision Banana 对语言鲁棒性较强,但仍有关键设计原则:
Veo 3.1增强了音频生成能力、提示词理解能力和角色一致性控制。支持多参考图生成、场景扩展(Scene Extension)、更长视频制作以及更精准的镜头控制,同时提升了画面真实感和叙事能力。是当前 Google 主推的旗舰视频生成模型。
- 明确主体+空间/属性约束:避免模糊表述。推荐结构:“位于[位置]的[属性]+[类别]”,例如“穿红裙子站在窗边的女孩”比“那个女孩”更可靠;
- 慎用绝对数量词:模型未内置计数机制,“第三棵树”可能失败,改用相对关系更稳,如“离镜头最近的那棵银杏树”;
- 颜色指令要可解码:若需后续自动提取,建议在 Prompt 中显式绑定 RGB 值,例如“把自行车车筐涂成 ”;
- 避免跨实例歧义:当多个对象共享相同描述时(如“戴眼镜的男人”有两位),需补充区分线索,比如“戴黑框眼镜、穿灰色毛衣的男人”。
从生成图提取掩码的实操步骤
模型输出是一张标准 RGB 图像,目标区域为纯色块。提取过程无需训练,纯后处理:
- 读取输出图像,转换为 numpy 数组;
- 设定 RGB 容差阈值(通常 ±10 即可),筛选出匹配目标色值的所有像素坐标;
- 将这些坐标映射回原始图像尺寸,生成 uint8 类型的二值掩码(1=目标,0=背景);
- 可选:对掩码做简单形态学闭运算,填补细小空洞,提升边缘连续性。
整个流程可在 OpenCV 或 PIL 中 5 行代码内完成,不依赖任何深度学习推理环境。
常见问题与应对建议
实际使用中几个高频卡点:
- 目标被遮挡或局部可见:模型仍能基于上下文补全语义,但建议 Prompt 中加入可见性提示,如“露出前爪和耳朵的那只猫”;
- 多尺度目标难定位:小物体易被忽略,可在 Prompt 开头加强调词,例如“请特别注意画面右下角那个约硬币大小的蓝色按钮”;
- 生成图含轻微噪点色斑:这是生成模型固有特性,建议提取掩码后加面积过滤——仅保留连通域面积 > 总图 0.1% 的区域;
- 同一 Prompt 多次运行结果略有差异:启用 deterministic sampling(如固定 temperature=0.1、top-k=50)可显著提升一致性。










