APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択-AI-php.cn

ホームページ

テクノロジー周辺機器

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Apr 07, 2024 pm 05:07 PM

プロジェクトapisr

「ドラゴンボール」「ポケモン」「新世紀エヴァンゲリオン」など、前世紀に放送されたアニメ作品は、多くの人々の幼少期の思い出の一部であり、私たちに情熱、友情、そして夢をもたらしてきました。 . ビジュアルジャーニー。ある時点で、私たちは突然これらの子供時代の思い出を再訪したいという衝動に駆られることがありますが、残念なことに、これらの子供時代の思い出の認識率は非常に低く、ワイドスクリーンテレビで良好な視覚体験を作り出すことは不可能であることに気づくかもしれません。これらの子供時代の思い出を、HD 解像度のデジタル世界で育った子供たちと共有してください。

このような悪質な競争（そして潜在的な市場）に対しては、アニメ会社にリメイクを制作してもらうのも一つの方法です。この作業は人的・経済的に多大な費用がかかりますが、問題を無視して市場シェアを失うよりは価値があるかもしれません。

マルチモーダル人工知能のパフォーマンスはますます強力になっており、AI ベースの超解像技術を使用してアニメーションの解像度を向上させることは、検討する価値のある方向性となっています。この技術は、少数の低解像度画像から高解像度画像を再構成し、アニメーション画像をより鮮明で詳細なものにすることができます。この手法は、多数のサンプルデータをトレーニングすることによって深度を利用します。最近、ミシガン大学、イェール大学、浙江大学の共同チームは、アニメーション制作プロセスを分析することにより、アニメーション超解像度タスク用のツールセットを作成しました。非常に実用的です。新しい方法。これには、データセット、モデル、およびいくつかの改善が含まれます。この研究は CVPR 2024 カンファレンスに採択されました。チームはまた、関連コードをオープンソース化し、Huggingface で試用モデルを開始しました。

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択さらに、このテクノロジを使用してビデオの解像度を向上させようとした人もいますが、素晴らしい結果が得られています。

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

アニメ制作プロセス

#この新しい手法の革新性を理解するために、まずアニメーションが一般的にどのように制作されるかを見てみましょう。

まず、人間が紙にスケッチし、コンピュータ生成画像 (CGI) 処理を通じて色付けされ、強化されます。これらの処理されたスケッチが接続されてビデオが作成されます。

ただし、描画プロセスは非常に手間がかかり、人間の目は動きに敏感ではないため、ビデオを合成する場合、業界標準では複数の連続フレームで 1 つの画像を再利用します。

このプロセスを分析することで、共同チームは、アニメーション超解像度モデルをトレーニングするためにビデオモデルとビデオデータセットを使用する必要があるかどうか疑問に思わずにはいられませんでした。画像に対して超解像度を実行することは完全に可能です。そしてこれらの画像を連結します。

そこで彼らは、画像ベースの手法とデータセットを使用して、画像とビデオに適した統一された超解像度と復元のフレームワークを作成することにしました。

新しい提案手法

アニメーション制作用画像超解像(API SR)データセット

チーム APIここでは、SR データセットが提案され、その収集と編成方法が簡単に紹介されます。この方法では、アニメーションビデオの特性 (図 2 を参照) を利用し、ビデオから最も圧縮率が低く、最も情報量の多いフレームを選択できます。

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択 I フレームベースの画像コレクション: ビデオ圧縮には、ビデオ品質とデータサイズの間のトレードオフが関係します。現在、多くのビデオ圧縮標準があり、それぞれに独自の複雑なエンジニアリングシステムがありますが、それらはすべて同様のバックボーン設計を持っています。

これらの特性により、各フレームの圧縮品質が異なります。ビデオ圧縮プロセスでは、いくつかのキーフレーム (つまり、I フレーム) を個別の圧縮単位として指定します。実際には、I フレームはシーンが変わるときの最初のフレームです。これらの I フレームは大量のデータを占有する可能性があります。非 I フレーム (つまり、P フレームと B フレーム) は圧縮率が高く、時間の経過に伴う変化を導入するために、圧縮プロセス中に I フレームを参照として使用する必要があります。図 3a に示すように、チームが収集したアニメーションビデオでは、一般に I フレームのデータサイズが非 I フレームのデータサイズよりも大きく、実際に I フレームの品質が高くなります。したがって、チームはビデオ処理ツール ffmpeg を使用してビデオソースからすべての I フレームを抽出し、それらを初期データプールとして使用しました。

Отбор на основе сложности изображения: команда проверила первоначальный пул I-кадров на основе оценки сложности изображения (ICA), которая является более подходящим индикатором для анимации, см. рисунок 4.

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

Набор данных API: команда вручную собрала 562 высококачественных аниме-видео. Затем на основе двух вышеуказанных шагов были собраны 10 кадров с наибольшим количеством очков из каждого видео. Затем была проведена некоторая фильтрация для удаления неподходящих изображений и в итоге был получен набор данных, содержащий 3740 изображений высокого качества. На рис. 5 показано несколько примеров изображений. Кроме того, на рисунке 3b мы также можем видеть преимущества набора данных API с точки зрения сложности изображения.

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

Вернемся к исходному разрешению 720P: Изучая процесс производства анимации, мы видим, что большая часть производства анимации использует формат 720P (то есть изображение имеет высоту 720 пикселей). ). Однако в реальных сценариях аниме часто ошибочно масштабируют до 1080P или других форматов в попытке стандартизировать мультимедийные форматы. Команда экспериментально обнаружила, что изменение размера всех аниме-изображений до исходного разрешения 720P обеспечивает плотность объектов, задуманную создателями, а также более четкие рисованные линии аниме и информацию CGI.

Практическая модель деградации для анимации

В реальных задачах со сверхвысоким разрешением разработка модели деградации очень важна. Основываясь на моделях деградации высокого порядка и недавней модели восстановления сжатия видео на основе изображений, команда предложила два улучшения, которые могут восстановить искаженные нарисованные от руки линии и различные артефакты сжатия, а также улучшить представление модели деградации. Рисунок 6а иллюстрирует эту модель деградации.

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

Сжатие, ориентированное на прогнозирование. Для задачи восстановления анимации артефактов сжатия видео использование моделей ухудшения качества изображения представляет собой сложную проблему. Это связано с тем, что метод сжатия формата изображения JPEG и принцип сжатия видео различны.

Чтобы справиться с такими трудностями, команда разработала модель сжатия, ориентированную на прогнозирование, используемую в модели ухудшения качества изображения. Для этого модуля требуется алгоритм сжатия видео для сжатия одного входного кадра.

При таком подходе модель деградации изображения способна синтезировать артефакты сжатия, аналогичные тем, которые наблюдаются при типичном многокадровом сжатии видео, как показано на рисунке 7. Затем, подавая эти синтезированные изображения в сеть изображений сверхвысокого разрешения, система может эффективно изучить закономерности различных артефактов сжатия и восстановить их.

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

Перетасуйте порядок изменения размера модулей: вырожденные модели в реальных областях сверхвысокого разрешения должны учитывать модули размытия, изменения размера, шума и сжатия. Размытие, шум и сжатие — это реальные артефакты, которые можно синтезировать с помощью четких математических моделей или алгоритмов. Однако логика модуля изменения размера совершенно другая. Изменение размера не является частью естественной генерации изображений, а введено специально для сверхразрешения парных наборов данных. Поэтому предыдущий модуль изменения размера фиксированного размера был не очень подходящим. Команда предложила более надежное и эффективное решение, которое предполагает случайное размещение операций изменения размера в разном порядке в вырожденной модели.

Улучшить нарисованные от руки линии для анимации

Команда решила напрямую извлечь информацию об уточненных нарисованных от руки линиях и сравнить ее с реальными данными (GT/ground -истина) слияния, образуя таким образом псевдо GT. Внедряя этот специально предназначенный улучшенный псевдо-GT в процесс обучения со сверхвысоким разрешением, сеть может генерировать четкие нарисованные от руки линии без введения дополнительных модулей нейронной сети или отдельных сетей постобработки.

Чтобы лучше извлекать нарисованные от руки линии, команда использовала XDoG — алгоритм извлечения эскизов, основанный на попиксельном ядре Гаусса, который может извлекать карты GT с острыми краями.

Однако карты ребер XDoG страдают от чрезмерного шума, содержат посторонние пиксели и изображения ломаных линий. Чтобы решить эту проблему, команда предложила метод фильтрации выбросов в сочетании со специально разработанным методом пассивного расширения. Таким образом, получается более связное и ненарушенное представление нарисованных от руки линий.

Команда экспериментально обнаружила, что чрезмерная резкость предварительно обработанного GT может сделать нарисованные от руки края линий более заметными, чем другие несущественные детали краев теней, что облегчает фильтру выбросов их различие. Для этого команда предложила сначала выполнить три раунда операций маскировки резкости на GT. Рисунок 8 дает простую иллюстрацию этого процесса.

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

Сбалансированная двойная потеря восприятия для анимации

Существует также проблема нежелательных цветовых артефактов, в основном из-за данных во время обучения несоответствие домена между генератором и потерей восприятия.

Чтобы решить эту проблему и компенсировать недостатки предыдущих методов, команда использовала предварительно обученный ResNet, который был обучен решению задачи классификации целей анимации на наборе данных Danbooru. Набор данных Danbooru — это база данных иллюстраций аниме, содержащая большие и насыщенные аннотации. Поскольку эта предварительно обученная сеть представляет собой ResNet50, а не VGG, команда также предложила аналогичное сравнение среднего уровня.

Однако, если вы используете только потери на основе ResNet, вы можете пострадать от плохих визуальных результатов. Это вызвано присущей набору данных Danbooru предвзятостью: большинство изображений в этом наборе данных представляют собой лица или относительно простые. , иллюстрация. Поэтому команда взвесила свое мнение и решила использовать реальные функции в качестве вспомогательного средства для управления потерей восприятия на основе ResNet во время обучения. Этот метод позволяет получить визуально приятное изображение, а также решить проблему нежелательных цветов.

Эксперимент

Детали реализации

В эксперименте команда использовала новый предложенный набор данных API в качестве сети изображений. набор обучающих данных. Что касается сети изображений, используется крошечная версия GRL с ближайшим модулем сверточной повышающей дискретизации.

Более подробную информацию и параметры см. в оригинальной статье.

Сравнение с лучшими на данный момент методами

Команда количественно и качественно сравнила недавно предложенный APISR с некоторыми другими передовыми методами, включая Real-ESRGAN, BSRGAN, RealBasicVSR, AnimeSR. и ВКД-СР.

Количественное сравнение

Как показано в таблице 1, новая модель имеет наименьший размер сети, всего 1,03 млн параметров, но ее производительность по всем показателям превосходит все остальные. , метод.

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

Команда особо подчеркнула роль моделей сжатия, ориентированных на прогнозирование.

Кроме того, следует отметить, что новый метод достигает таких результатов только при сложности обучающей выборки 13,3% и 25% для AnimeSR и VQDSR соответственно. В основном это связано с введением оценки сложности изображения в процесс сортировки набора данных, что может улучшить эффект обучения представлению анимационных изображений путем выбора насыщенных информацией изображений. Более того, благодаря новой модели явной деградации обучение модели деградации не требуется.

Качественное сравнение

Как показано на рисунке 10, визуальное качество, полученное с помощью APISR, намного лучше, чем другие методы.

APISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択

Команда также провела исследование абляции, чтобы проверить эффективность нового набора данных, модели деградации и расчета потерь. Подробности см. в исходном документе.

以上がAPISR、2次元専用の超解像度AIモデル：オンラインで入手可能、CVPRによって選択の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明

この記事は机器之心で複製されています。侵害がある場合は、admin@php.cn までご連絡ください。

AIのスキルギャップは、サプライチェーンのダウンを遅くしていますApr 26, 2025 am 11:13 AM

「AI-Ready労働力」という用語は頻繁に使用されますが、サプライチェーン業界ではどういう意味ですか？サプライチェーン管理協会（ASCM）のCEOであるAbe Eshkenaziによると、批評家ができる専門家を意味します

1つの会社がAIを永遠に変えるために静かに取り組んでいる方法Apr 26, 2025 am 11:12 AM

分散型AI革命は静かに勢いを増しています。今週の金曜日、テキサス州オースティンでは、ビテンサーのエンドゲームサミットは極めて重要な瞬間を示し、理論から実用的な応用に分散したAI（DEAI）を移行します。派手なコマーシャルとは異なり

Nvidiaは、AIエージェント開発を合理化するためにNEMOマイクロサービスをリリースしますApr 26, 2025 am 11:11 AM

エンタープライズAIはデータ統合の課題に直面していますエンタープライズAIの適用は、ビジネスデータを継続的に学習することで正確性と実用性を維持できるシステムを構築する大きな課題に直面しています。 NEMOマイクロサービスは、NVIDIAが「データフライホイール」と呼んでいるものを作成することにより、この問題を解決し、AIシステムがエンタープライズ情報とユーザーインタラクションへの継続的な露出を通じて関連性を維持できるようにします。この新しく発売されたツールキットには、5つの重要なマイクロサービスが含まれています。 NEMOカスタマイザーは、より高いトレーニングスループットを備えた大規模な言語モデルの微調整を処理します。 NEMO評価者は、カスタムベンチマークのAIモデルの簡素化された評価を提供します。 Nemo Guardrailsは、コンプライアンスと適切性を維持するためにセキュリティ管理を実装しています

aiは芸術とデザインの未来のために新しい絵を描きますApr 26, 2025 am 11:10 AM

AI：芸術とデザインの未来人工知能（AI）は、前例のない方法で芸術とデザインの分野を変えており、その影響はもはやアマチュアに限定されませんが、より深く影響を与えています。 AIによって生成されたアートワークとデザインスキームは、広告、ソーシャルメディアの画像生成、Webデザインなど、多くのトランザクションデザインアクティビティで従来の素材画像とデザイナーに迅速に置き換えられています。ただし、プロのアーティストやデザイナーもAIの実用的な価値を見つけています。 AIを補助ツールとして使用して、新しい美的可能性を探求し、さまざまなスタイルをブレンドし、新しい視覚効果を作成します。 AIは、アーティストやデザイナーが繰り返しタスクを自動化し、さまざまなデザイン要素を提案し、創造的な入力を提供するのを支援します。 AIはスタイル転送をサポートします。これは、画像のスタイルを適用することです

エージェントAIとのズームがどのように革命を起こしているか：会議からマイルストーンまでApr 26, 2025 am 11:09 AM

最初はビデオ会議プラットフォームで知られていたZoomは、エージェントAIの革新的な使用で職場革命をリードしています。 ZoomのCTOであるXD Huangとの最近の会話は、同社の野心的なビジョンを明らかにしました。エージェントAIの定義 huang d

大学に対する実存的な脅威Apr 26, 2025 am 11:08 AM

AIは教育に革命をもたらしますか？この質問は、教育者と利害関係者の間で深刻な反省を促しています。 AIの教育への統合は、機会と課題の両方をもたらします。 Tech Edvocate NotesのMatthew Lynch、Universitとして

プロトタイプ：アメリカの科学者は海外の仕事を探していますApr 26, 2025 am 11:07 AM

米国における科学的研究と技術の開発は、おそらく予算削減のために課題に直面する可能性があります。 Natureによると、海外の雇用を申請するアメリカの科学者の数は、2024年の同じ期間と比較して、2025年1月から3月まで32％増加しました。以前の世論調査では、調査した研究者の75％がヨーロッパとカナダでの仕事の検索を検討していることが示されました。 NIHとNSFの助成金は過去数か月で終了し、NIHの新しい助成金は今年約23億ドル減少し、3分の1近く減少しました。リークされた予算の提案は、トランプ政権が科学機関の予算を急激に削減していることを検討しており、最大50％の削減の可能性があることを示しています。基礎研究の分野での混乱は、米国の主要な利点の1つである海外の才能を引き付けることにも影響を与えています。 35

Openaiは、強力なGPT-4.1シリーズを発表しました。実際のアプリケーション向けに設計された3つの高度な言語モデルのファミリー。この大幅な飛躍は、より速い応答時間、理解の強化、およびTと比較した大幅に削減されたコストを提供します

See all articles

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

PhpStorm Mac バージョン

最新(2018.2.1)のプロフェッショナル向けPHP統合開発ツール

mPDF

mPDF は、UTF-8 でエンコードされた HTML から PDF ファイルを生成できる PHP ライブラリです。オリジナルの作者である Ian Back は、Web サイトから「オンザフライ」で PDF ファイルを出力し、さまざまな言語を処理するために mPDF を作成しました。 HTML2FPDF などのオリジナルのスクリプトよりも遅く、Unicode フォントを使用すると生成されるファイルが大きくなりますが、CSS スタイルなどをサポートし、多くの機能強化が施されています。 RTL (アラビア語とヘブライ語) や CJK (中国語、日本語、韓国語) を含むほぼすべての言語をサポートします。ネストされたブロックレベル要素 (P、DIV など) をサポートします。

MinGW - Minimalist GNU for Windows

このプロジェクトは osdn.net/projects/mingw に移行中です。引き続きそこでフォローしていただけます。 MinGW: GNU Compiler Collection (GCC) のネイティブ Windows ポートであり、ネイティブ Windows アプリケーションを構築するための自由に配布可能なインポートライブラリとヘッダーファイルであり、C99 機能をサポートする MSVC ランタイムの拡張機能が含まれています。すべての MinGW ソフトウェアは 64 ビット Windows プラットフォームで実行できます。