本文将介绍一种通过BEV Sketch布局来精确生成多视角街景图片的方法
在自动驾驶领域,图像合成被广泛应用于提升下游感知任务的性能
在计算机视觉领域,提升感知模型性能的一个长期存在的研究难题是通过合成图像来实现。在以视觉为中心的自动驾驶系统中,使用多视角摄像头,这个问题变得更加突出,因为有些长尾场景是永远无法收集到的
根据图1(a)所示,现有的生成方法将语义分割风格的BEV结构输入生成网络,并输出合理的多视角图像。在仅根据场景级指标进行评估时,现有方法似乎能合成照片般逼真的街景图像。然而,一旦放大,我们发现它无法生成准确的对象级别的细节。图中,我们展示了目前最先进生成算法的一个常见错误,即生成的车辆与目标3D边界框相比方向完全相反。此外,编辑语义分割样式的BEV结构是一项艰巨的任务,需要大量人力
因此,我们提出了一种名为BEVControl的两阶段方法,用于提供更精细的背景和前景几何控制,如图1(b)所示。BEVControl支持草图风格的BEV结构输入,可以实现快速简便的编辑。此外,我们的BEVControl将视觉一致性分解为两个子目标:通过控制器(Controller)实现街道视图和鸟瞰视图之间的几何一致性;通过协调器(Coordinator)实现街道视图之间的外观一致性
论文链接:https://www.php.cn/link/1531beb762df4029513ebf9295e0d34f
需要重写的内容是:参考文献
需要重写的内容是:[1] Swerdlow A, Xu R, Zhou B. 从鸟瞰布局生成街景图像[J]. arXiv预印本 arXiv:2301.04634, 2023.
以上是背景与前景控制更加精细,编辑更加快捷:BEVControl的两阶段方法的详细内容。更多信息请关注PHP中文网其他相关文章!