画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案-AI-php.cn

ホームページ

テクノロジー周辺機器

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

王林

Apr 14, 2023 pm 04:31 PM

システム電車

この記事では、機械学習に関するトップの国際会議である AAAI 2023 に採択された論文「Improving Training and Inference of Face Recognition Models via Random Speed Scaling」を紹介します。この論文は、温度調整パラメータと分類損失関数における分類不確実性の間の内部関係を確率論的な観点から革新的に分析し、分類損失関数の温度調整係数がガンベル分布に従う不確実性変数のスケール係数であることを明らかにしました。したがって、特徴抽出の信頼性をモデル化するために、RTS と呼ばれる新しいトレーニングフレームワークが提案されています。 RTS トレーニングフレームワークに基づいて、より信頼性の高い認識モデルがトレーニングされ、トレーニングプロセスがより安定し、展開中にサンプルの不確実性の測定スコアを提供して、不確実性の高いサンプルを拒否し、より堅牢な視覚認識システムの構築に役立ちます。広範な実験により、RTS が安定してトレーニングし、不確実性の尺度を出力して堅牢な視覚認識システムを構築できることが示されました。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

紙のアドレス: https://arxiv.org/abs/2212.01015
#オープンソースモデル: https://modelscope.cn/models/damo/cv_ir_face-recognition-ood_rts/summary#背景

不確実性の問題:

視覚認識システムは通常、実際のシーンでさまざまな干渉に遭遇します。例: オクルージョン (装飾または複雑な前景)、イメージングブラー (フォーカスブラーまたはモーションブラー)、極端な照明 (露出オーバーまたは露出不足など)。これらの干渉はノイズの影響として要約できますが、さらに猫の顔や犬の顔などの画像の誤検出もあり、これらの誤検出データは分布外 (OOD) データと呼ばれます。視覚認識においては、前述のノイズやOODデータが不確実性の源となり、影響を受けるサンプルは深度モデルに基づいて抽出された特徴量に不確実性を重畳し、視覚認識システムに干渉を引き起こします。たとえば、ベースライブラリ画像が不確実な干渉を持つサンプルによって汚染されている場合、「特徴ブラックホール」が形成され、視覚認識システムに隠れた危険をもたらします。したがって、表現の信頼性をモデル化する必要があります。特性評価信頼性モデリングに関する関連研究

従来のマルチモデルソリューション

従来の視覚認識リンクの信頼性を制御する方法は、独立した品質モデルを通じて行われます。典型的な画質モデリング方法は次のとおりです:

1. 注釈データを収集し、明瞭さ、オクルージョンの有無、姿勢など、品質に影響を与える特定の要素に注釈を付けます。

2. 影響因子のラベルに従って、品質スコアを 1 から 10 までマッピングします。スコアが高いほど、品質は高くなります。具体的な例については、例を参照してください。下の図の左側にあります。

3. 最初の 2 つのステップで品質スコアのアノテーションを取得した後、順序回帰トレーニングを実行して、図の右側の例に示すように、導入フェーズ中の品質スコアを予測します。下の図。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案 #独立した品質モデルソリューションでは、視覚認識リンクに新しいモデルを導入する必要があり、トレーニングは以下に依存します。注釈情報。

DUL

不確実性モデリング手法には、「顔認識におけるデータ不確実性学習」が含まれます。はガウス分布の平均と分散の合計として計算され、不確実性を含む特徴はトレーニングのために後続の分類器に送信されます。したがって、画質に関連する不確実性スコアは展開段階で取得できます。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案 DUL は、不確実性を記述するために加算法を使用します。ノイズ推定のスケールも、ノイズ推定のスケールと同じです。特定の種類のデータ。特徴分布は密接に関係しています。データの分布が比較的密である場合、DUL によって推定されるノイズの規模も比較的小さくなります。 OOD 分野の研究では、データ分布の密度は OOD を識別するための適切な指標ではないことが指摘されています。

ゴディン

OOD 分野の研究「一般化 odin: 分布外データから学習せずに分布外画像を検出する」では、2 つの独立したブランチを使用して、同時確率分布の形式を使用して OOD データを処理します。 h(x)とg(x)は分類確率値と温度調整値を推定します。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

温度値は確率値としてモデル化され、範囲は 0 ～ 1 に制限されているため、温度のモデル化は適切ではありません。

方法

上記の問題と関連研究を考慮して、この論文は確率の観点から開始し、温度調整係数と分類における不確実性の関係を研究します。損失関数分析後、RTS トレーニングフレームワークが提案されます。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

確率的観点に基づく体温調節因子の分析

#まず、温度調整係数と不確かさの関係を分析します。

不確実性が標準ガンベル分布に準拠する確率変数であると仮定すると、確率密度関数は画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案 # のように記述できます。

## ,

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案累積分布関数は # であり、クラス k に分類されるの確率値は次のとおりです:

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

を上の式に代入すると、次のようになります: 画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案 ##k クラスに分類された確率値は、softmax 関数に従うスコアであることがわかります。同時に、t を使用してスケールを調整することができます。不確実性、つまり、標準ガンベル分布に準拠します。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案確率値が次のように分類されることがわかります。このときのクラス k は、温度調整値 t Score のソフトマックス関数と一致します。

モデリング温度

分類に対する不確実性推定の影響を軽減するには、温度 t が 1 に近い必要があるため、温度 t を画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案独立したガンマ分布変数の合計としてモデル化します。 :where、t が

## に従うように、beta = frac {alpha - 1 } {v})$ 分布。 v と画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案が分布に与える影響は以下のとおりです。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

#温度モデリングの制約は、トレーニング中に次の通常の用語を使用して実装されます

##トレーニング方法画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

全体的なアルゴリズムは次のように構成されています:

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案さらに詳細な分析と理論的証明については、論文を参照してください。

#結果

トレーニングフェーズでは、トレーニングデータには顔のトレーニングデータのみが含まれます。誤って検出された猫の顔と犬の顔の OOD データは、テスト中に OOD データの認識効果を検証するために使用されます。このテストは、トレーニングプロセスのさまざまな段階での OOD サンプルの不確実性の動的なプロセスを示しています。

トレーニングフェーズ

分布内データ (顔) と分布外データを描画します。異なるエポック番号におけるデータ (猫の顔と犬の顔が誤って顔として検出されたもの) の不確実性スコアを比較した結果、以下の図から、初期段階ではすべてのサンプルの不確実性スコアがより大きな値付近に分布し、その後はトレーニングが進むと、OOD サンプルの不確実性が徐々に増加し、顔データの不確実性が徐々に減少します。顔の品質が良くなるほど、不確実性は低くなります。 IDデータとOODデータは閾値を設定することで区別でき、画質は不確実性スコアに反映されます。

#トレーニング段階でのノイズの多いトレーニングデータに対する堅牢性を説明するため。この記事では、さまざまな割合のノイズをトレーニングセットに適用します。さまざまな割合のノイズトレーニングデータに基づくモデル認識効果は次のとおりです。RTS は、ノイズデータに基づくトレーニングでもより良い認識結果を達成できることがわかります。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

展開フェーズ画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

画像以下は、展開フェーズ中に RTS フレームワークによって取得された不確実性スコアが顔の品質と高い相関関係があることを示しています

同時に、低品質のサンプルを除去した後のエラーマッチング曲線がベンチマーク上にプロットされます。得られた不確実性スコアに基づいて、ベンチマークの不確実性が高いサンプルを不確実性の高いものから低いものへ順に除去し、残りのサンプルの誤差マッチング曲線を描画します。以下の図からわかるように、不確実性の高いサンプルがより多くフィルタリングされると、誤一致は少なくなり、同じ数の不確実性サンプルが除去されると、RTS の誤一致は少なくなります。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

#OOD サンプルに対する不確実性スコアの識別効果を検証するために、流通中のデータセットを使用しました。テスト中に構築されたデータセット（顔）と配布外のデータセット（誤って顔として検出された猫の顔と犬の顔）。データサンプルは以下の通りです。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

#RTS の効果を 2 つの側面から説明します。まず不確かさの分布図を描くと、下図のように RTS 法は OOD データに対して強い識別能力を持っています。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

同時に、OOD テストセットの ROC 曲線も描画され、その AUC 値はご覧のとおり、ROC 権限が計算されました。RTS の不確実性スコアにより、OOD データをより適切に識別できます。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

#一般的な認識能力

ベンチマークで一般的な認識能力をテストするために、RTS は顔認識能力に影響を与えることなく OOD データの認識能力を高めます。 RTS アルゴリズムを使用すると、識別と OOD データ識別においてバランスの取れた結果を達成できます。

画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

#適用画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案

この記事モデルはmodelscopeでオープンソース化されています。さらに、CV ドメインのオープンソースの無料モデルを紹介したいと思います。誰でも体験してダウンロードすることができます (ほとんどの携帯電話で体験できます):

1.https://modelscope.cn/models/damo/cv_resnet50_face-detection_retinaface/summary

#2.https://modelscope.cn/models/damo/cv_resnet101_face-detection_cvpr22papermogface/summary

3.https://modelscope.cn/models/damo/cv_manual_face-detection_tinymog/summary

4.https://modelscope. cn/models/damo/cv_manual_face-detection_ulfd /summary

5.https://modelscope.cn/models/damo/cv_manual_face-detection_mtcnn/summary

6.https:/ /modelscope.cn/models/damo/cv_resnet_face-recognition_facemask/summary

7.https://modelscope.cn/models/damo/cv_ir50_face -recognition_arcface/summary

8. https://modelscope.cn/models/damo/cv_manual_face-liveness_flir/summary

9.https ://modelscope.cn/models/damo/cv_manual_face-liveness_flrgb/summary

10.https://modelscope.cn/models/damo/cv_manual_facial-landmark-confidence_flcm/summary

11.https://modelscope.cn/models/damo/cv_vgg19_facial-expression-recognition_fer/summary

12.https:// modelscope.cn/models/damo/cv_resnet34_face -attribute-recognition_fairface/summary

以上が画質による視覚認識の妨げを懸念、DAMOアカデミーがより堅牢なフレームワークを提案の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明

この記事は51CTO.COMで複製されています。侵害がある場合は、admin@php.cn までご連絡ください。

Huggingface smollmであなたの個人的なAIアシスタントを構築する方法Apr 18, 2025 am 11:52 AM

オンデバイスAIの力を活用：個人的なチャットボットCLIの構築最近では、個人的なAIアシスタントの概念はサイエンスフィクションのように見えました。ハイテク愛好家のアレックスを想像して、賢くて地元のAI仲間を夢見ています。

メンタルヘルスのためのAIは、スタンフォード大学でのエキサイティングな新しいイニシアチブによって注意深く分析されますApr 18, 2025 am 11:49 AM

AI4MHの最初の発売は2025年4月15日に開催され、有名な精神科医および神経科学者であるLuminary Dr. Tom Insel博士がキックオフスピーカーを務めました。 Insel博士は、メンタルヘルス研究とテクノでの彼の傑出した仕事で有名です

2025年のWNBAドラフトクラスは、成長し、オンラインハラスメントの成長と戦いに参加しますApr 18, 2025 am 11:44 AM

「私たちは、WNBAが、すべての人、プレイヤー、ファン、企業パートナーが安全であり、大切になり、力を与えられたスペースであることを保証したいと考えています」とエンゲルバートは述べ、女性のスポーツの最も有害な課題の1つになったものに取り組んでいます。アノ

Pythonビルトインデータ構造の包括的なガイド-AnalyticsVidhyaApr 18, 2025 am 11:43 AM

導入 Pythonは、特にデータサイエンスと生成AIにおいて、プログラミング言語として優れています。大規模なデータセットを処理する場合、効率的なデータ操作（ストレージ、管理、アクセス）が重要です。以前に数字とstをカバーしてきました

Openaiの新しいモデルからの代替案からの第一印象Apr 18, 2025 am 11:41 AM

潜る前に、重要な注意事項：AIパフォーマンスは非決定論的であり、非常にユースケース固有です。簡単に言えば、走行距離は異なる場合があります。この（または他の）記事を最終的な単語として撮影しないでください。これらのモデルを独自のシナリオでテストしないでください

AIポートフォリオ| AIキャリアのためにポートフォリオを構築する方法は？Apr 18, 2025 am 11:40 AM

傑出したAI/MLポートフォリオの構築：初心者と専門家向けガイド説得力のあるポートフォリオを作成することは、人工知能（AI）と機械学習（ML）で役割を確保するために重要です。このガイドは、ポートフォリオを構築するためのアドバイスを提供します

エージェントAIがセキュリティ運用にとって何を意味するのかApr 18, 2025 am 11:36 AM

結果？燃え尽き症候群、非効率性、および検出とアクションの間の隙間が拡大します。これは、サイバーセキュリティで働く人にとってはショックとしてはありません。しかし、エージェントAIの約束は潜在的なターニングポイントとして浮上しています。この新しいクラス

Google対Openai：学生のためのAIの戦いApr 18, 2025 am 11:31 AM

即時の影響と長期パートナーシップ？ 2週間前、Openaiは強力な短期オファーで前進し、2025年5月末までに米国およびカナダの大学生にChatGpt Plusに無料でアクセスできます。このツールにはGPT ‑ 4o、Aが含まれます。

See all articles

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

Safe Exam Browser

Safe Exam Browser は、オンライン試験を安全に受験するための安全なブラウザ環境です。このソフトウェアは、あらゆるコンピュータを安全なワークステーションに変えます。あらゆるユーティリティへのアクセスを制御し、学生が無許可のリソースを使用するのを防ぎます。

WebStorm Mac版

便利なJavaScript開発ツール

SAP NetWeaver Server Adapter for Eclipse

Eclipse を SAP NetWeaver アプリケーションサーバーと統合します。

MinGW - Minimalist GNU for Windows

このプロジェクトは osdn.net/projects/mingw に移行中です。引き続きそこでフォローしていただけます。 MinGW: GNU Compiler Collection (GCC) のネイティブ Windows ポートであり、ネイティブ Windows アプリケーションを構築するための自由に配布可能なインポートライブラリとヘッダーファイルであり、C99 機能をサポートする MSVC ランタイムの拡張機能が含まれています。すべての MinGW ソフトウェアは 64 ビット Windows プラットフォームで実行できます。