検索
ホームページテクノロジー周辺機器AIより詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

この記事では、BEV Sketch レイアウトを通じてマルチビューのストリートビュー画像を正確に生成する方法を紹介します

より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

自動運転の分野では、画像合成が広く使用されています。下流の知覚を改善する タスクのパフォーマンスを改善する

コンピュータ ビジョンの分野において、知覚モデルのパフォーマンスを向上させるための長年の研究課題は、画像を合成することによってそれを達成することです。マルチビューカメラを使用するビジョン中心の自動運転システムでは、一部のロングテールシーンが収集できないため、この問題はより顕著になります。図1(a)、既存の生成方法は、セマンティックセグメンテーションスタイルのBEV構造を生成ネットワークに入力し、合理的な多視点画像を出力します。シーンレベルの指標のみで評価すると、既存の方法はフォトリアリスティックなストリートビュー画像を合成できるように見えます。しかし、ズームインすると、正確なオブジェクトレベルの詳細を生成できないことがわかりました。この図では、最先端の生成アルゴリズムによくある間違い、つまり、生成された車両がターゲットの 3D バウンディング ボックスと比較して完全に反対方向を向いていることを示しています。さらに、セマンティックセグメンテーション方式の BEV 構造の編集は多くの人手を必要とする困難な作業であるため、図 1(b) に示すように、より洗練された背景と前景の形状を提供する BEVControl と呼ばれる 2 段階の手法を提案します。 。 BEVControl はスケッチ スタイルの BEV 構造入力をサポートしており、迅速かつ簡単な編集が可能です。さらに、BEVControl は視覚的な一貫性を 2 つのサブ目標に分解します: コントローラーを介したストリート ビューと鳥瞰図間の幾何学的一貫性、コーディネーターを介したストリート ビュー間の外観の一貫性

より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

##Paperリンク:

https://www.php.cn/link/1531beb762df4029513ebf9295e0d34f

より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

#メソッドフレームワーク

BEVControl は、一連のモジュールで構成される、UNet 構造の生成されたネットワークです。各モジュールには、コントローラーとコーディネーターという 2 つの要素があります。

入力: BEV スケッチ、マルチビュー ノイズ イメージ、および簡単に編集できるテキスト プロンプト; より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ出力: 生成されたマルチビュー イメージ。

    #メソッドの詳細
BEV スケッチをカメラの状態に投影するプロセス。入力は BEV スケッチです。出力は、マルチビューの前景条件と背景条件です。

より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

コントローラー: カメラ ビュー スケッチの前景と背景の情報を自発的に受信し、BEV スケッチ Streetscape との幾何学的一貫性を出力します。特徴。
  • コーディネーター: 新しいクロスビューおよびクロスエレメント アテンション メカニズムを利用して、ビュー間のコンテキスト インタラクションを実現し、外観の一貫性を保ったストリート ビュー機能を出力します。

より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ提案された評価指標

  • 最近のストリート ビュー画像生成作業では、シーン レベルの指標 (FID、道路 MIoU、など)品質。
  • 以下の図に示すように、これらの指標のみを使用して生成ネットワークの真の生成能力を評価することは不可能であることがわかりました。報告された定性的および定量的結果は、両方のグループが同様の FID スコアを持つストリート ビュー画像を生成するものの、前景と背景をきめ細かく制御する機能が大きく異なることを示しています。

そこで、生成されたネットワークの制御能力を細かく測定するための評価指標セットを提案します。

  • 定量的結果
BEVControl と提案された最先端の手法の比較評価指標。

より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

データ拡張に BEVControl を適用して、ターゲット検出タスクを改善します。

    定性的結果

    • BEVControl と NuScenes 検証セットでの最先端のメソッドの比較。

    より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

    より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

    デモ効果

    より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ

    より詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチ##書き換える必要がある内容は次のとおりです。 参照

    書き換える必要がある内容は次のとおりです。 [1] Swerdlow A、Xu R、Zhou B。鳥瞰図レイアウト[ J]. arXiv プレプリント arXiv:2301.04634, 2023.

以上がより詳細な背景と前景の制御、より高速な編集: BEVControl の 2 段階のアプローチの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明
この記事は机器之心で複製されています。侵害がある場合は、admin@php.cn までご連絡ください。
最高の迅速なエンジニアリング技術の最新の年次編集最高の迅速なエンジニアリング技術の最新の年次編集Apr 10, 2025 am 11:22 AM

私のコラムに新しいかもしれない人のために、具体化されたAI、AI推論、AIのハイテクブレークスルー、AIの迅速なエンジニアリング、AIのトレーニング、AIのフィールディングなどのトピックなど、全面的なAIの最新の進歩を広く探求します。

ヨーロッパのAI大陸行動計画:GigaFactories、Data Labs、Green AIヨーロッパのAI大陸行動計画:GigaFactories、Data Labs、Green AIApr 10, 2025 am 11:21 AM

ヨーロッパの野心的なAI大陸行動計画は、人工知能のグローバルリーダーとしてEUを確立することを目指しています。 重要な要素は、AI GigaFactoriesのネットワークの作成であり、それぞれが約100,000の高度なAIチップを収容しています。

Microsoftの簡単なエージェントストーリーは、より多くのファンを作成するのに十分ですか?Microsoftの簡単なエージェントストーリーは、より多くのファンを作成するのに十分ですか?Apr 10, 2025 am 11:20 AM

AIエージェントアプリケーションに対するMicrosoftの統一アプローチ:企業の明確な勝利 新しいAIエージェント機能に関するマイクロソフトの最近の発表は、その明確で統一されたプレゼンテーションに感銘を受けました。 TEで行き詰まった多くのハイテクアナウンスとは異なり

従業員へのAI戦略の販売:Shopify CEOのマニフェスト従業員へのAI戦略の販売:Shopify CEOのマニフェストApr 10, 2025 am 11:19 AM

Shopify CEOのTobiLütkeの最近のメモは、AIの能力がすべての従業員にとって基本的な期待であると大胆に宣言し、会社内の重大な文化的変化を示しています。 これはつかの間の傾向ではありません。これは、pに統合された新しい運用パラダイムです

IBMは、完全なAI統合でZ17メインフレームを起動しますIBMは、完全なAI統合でZ17メインフレームを起動しますApr 10, 2025 am 11:18 AM

IBMのZ17メインフレーム:AIを強化した事業運営の統合 先月、IBMのニューヨーク本社で、Z17の機能のプレビューを受け取りました。 Z16の成功に基づいて構築(2022年に開始され、持続的な収益の成長の実証

5 chatgptプロンプトは他の人に依存して停止し、自分を完全に信頼する5 chatgptプロンプトは他の人に依存して停止し、自分を完全に信頼するApr 10, 2025 am 11:17 AM

揺るぎない自信のロックを解除し、外部検証の必要性を排除します! これらの5つのCHATGPTプロンプトは、完全な自立と自己認識の変革的な変化に向けて導きます。 ブラケットをコピー、貼り付け、カスタマイズするだけです

AIはあなたの心に危険なほど似ていますAIはあなたの心に危険なほど似ていますApr 10, 2025 am 11:16 AM

人工知能のセキュリティおよび研究会社であるAnthropicによる最近の[研究]は、これらの複雑なプロセスについての真実を明らかにし始め、私たち自身の認知領域に不穏に似た複雑さを示しています。自然知能と人工知能は、私たちが思っているよりも似ているかもしれません。 内部スヌーピング:人類の解釈可能性研究 人類によって行われた研究からの新しい発見は、AIの内部コンピューティングをリバースエンジニアリングすることを目的とする機械的解釈可能性の分野の大きな進歩を表しています。AIが何をするかを観察するだけでなく、人工ニューロンレベルでそれがどのように行うかを理解します。 誰かが特定のオブジェクトを見たり、特定のアイデアについて考えたりしたときに、どのニューロンが発射するかを描くことによって脳を理解しようとすることを想像してください。 a

Dragonwingは、QualcommのEdge Momentumを紹介していますDragonwingは、QualcommのEdge Momentumを紹介していますApr 10, 2025 am 11:14 AM

Qualcomm's DragonWing:企業とインフラストラクチャへの戦略的な飛躍 Qualcommは、新しいDragonwingブランドで世界的に企業やインフラ市場をターゲットにして、モバイルを超えてリーチを積極的に拡大しています。 これは単なるレブランではありません

See all articles

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

Safe Exam Browser

Safe Exam Browser

Safe Exam Browser は、オンライン試験を安全に受験するための安全なブラウザ環境です。このソフトウェアは、あらゆるコンピュータを安全なワークステーションに変えます。あらゆるユーティリティへのアクセスを制御し、学生が無許可のリソースを使用するのを防ぎます。

SublimeText3 Mac版

SublimeText3 Mac版

神レベルのコード編集ソフト(SublimeText3)

AtomエディタMac版ダウンロード

AtomエディタMac版ダウンロード

最も人気のあるオープンソースエディター

SublimeText3 英語版

SublimeText3 英語版

推奨: Win バージョン、コードプロンプトをサポート!

メモ帳++7.3.1

メモ帳++7.3.1

使いやすく無料のコードエディター