Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！-AI-php.cn

ホームページ

テクノロジー周辺機器

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Jan 11, 2024 pm 04:12 PM

ビデオデータ

過去 2 年間で、LAION-5B のような大規模なグラフィックおよびテキストデータセットの公開により、画像生成の分野では安定拡散などの驚くべき効果をもたらす一連の手法が登場しました。、DALL-E 2、ControlNet、および Composer 。これらの方法の出現により、画像生成の分野に大きな進歩と進歩がもたらされました。画像生成の分野は、過去 2 年間で急速に発展しました。

しかし、ビデオ生成は依然として大きな課題に直面しています。まず、画像生成と比較して、ビデオ生成では高次元のデータを処理する必要があり、追加の時間次元を考慮する必要があるため、タイミングモデリングの問題が生じます。時間ダイナミクスの学習を推進するには、より多くのビデオとテキストのペアのデータが必要です。ただし、ビデオの正確な時間的アノテーションは非常に高価であり、ビデオテキストデータセットのサイズが制限されます。現在、既存の WebVid10M ビデオデータセットには 1,070 万のビデオとテキストのペアしか含まれておらず、LAION-5B 画像データセットと比較すると、データサイズが大きく異なります。これにより、ビデオ生成モデルの大規模な拡張の可能性が大幅に制限されます。

上記の問題を解決するために、華中科技大学、アリババグループ、浙江大学、アントグループの共同研究チームは最近、TF-T2V ビデオソリューションをリリースしました。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

##文書アドレス: https://arxiv.org/abs/2312.15770

##プロジェクトのホームページ: https://tf-t2v.github.io/

ソースコードは間もなくリリースされます: https://github.com/ali-vilab /i2vgen-xl (VGen プロジェクト) 。

このソリューションは、異なるアプローチを採用し、リッチモーションダイナミクスを学習できる、大規模なテキストなしの注釈付きビデオデータに基づくビデオ生成を提案します。

# まずは TF-T2V のビデオ生成効果を見てみましょう:

文生ビデオタスク

プロンプトワード: 雪に覆われた土地に生息する大きな霜のような生き物のビデオを生成します。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！プロンプトワード: 漫画のミツバチのアニメーションビデオを生成します。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！プロンプトワード: 未来的なファンタジーバイクを含むビデオを生成します。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！プロンプトワード: 幸せそうに笑っている小さな男の子のビデオを生成します。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！プロンプトワード: 頭痛を感じている老人のビデオを生成します。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！ #結合ビデオ生成タスク

指定されたテキストと深度マップまたはテキストTF-T2V は、制御可能なビデオ生成を実行できます:

高解像度ビデオ合成も実行できます: Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

半教師あり設定

半教師あり設定の TF-T2V メソッドは、動きの記述に準拠したビデオを生成することもできます。「人々は右から左へ走る」などのテキスト。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

メソッドの紹介

中心となるアイデアTF-T2V モデルは動作ブランチと外観ブランチに分かれており、動作ブランチは運動ダイナミクスのモデル化に使用され、外観ブランチは視覚的な外観情報の学習に使用されます。これら 2 つのブランチは共同でトレーニングされ、最終的にテキスト駆動のビデオ生成を実現できます。

生成されたビデオの時間的一貫性を向上させるために、著者チームは、ビデオフレーム間の連続性を明示的に学習するための時間的一貫性の損失も提案しました。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

TF-T2V は、Vincent ビデオタスクだけでなく、結合されたビデオ生成タスクにも適した一般的なフレームワークであることは言及する価値があります。、スケッチからビデオへの変換、ビデオ修復、最初のフレームからビデオへの変換など。

具体的な詳細とさらなる実験結果については、元の論文またはプロジェクトのホームページを参照してください。

さらに、著者チームは TF-T2V を教師モデルとして使用し、一貫した蒸留技術を使用して VideoLCM モデルを取得しました。

論文アドレス: https://arxiv.org/abs/2312.09109 Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

プロジェクトのホームページ: https://tf-t2v.github.io/

ソースコードは間もなくリリースされます: https://github.com/ali-vilab/i2vgen-xl (VGen プロジェクト)。

約 50 ステップの DDIM ノイズ除去を必要とする以前のビデオ生成手法とは異なり、TF-T2V に基づく VideoLCM 手法は、わずか約 4 ステップの推論ノイズ除去で忠実度の高いビデオを生成できます。ビデオ生成の効率が大幅に向上します。

#VideoLCM の 4 ステップのノイズ除去推論の結果を見てみましょう:

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

##具体的な詳細とさらなる実験結果については、元の VideoLCM 論文またはプロジェクトのホームページを参照してください。

Huake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！

つまり、TF-T2V ソリューションはビデオ生成の分野に新しいアイデアをもたらし、データセットのサイズとラベル付けの難しさによって引き起こされる課題を克服します。 TF-T2V は、大規模なテキストフリーの注釈ビデオデータを活用して高品質のビデオを生成でき、さまざまなビデオ生成タスクに適用されます。このイノベーションはビデオ生成技術の開発を促進し、より幅広い応用シナリオとビジネスチャンスをあらゆる階層にもたらします。

以上がHuake、Aliなどが共同開発したTF-T2V技術でAI動画制作コストを削減！の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明

この記事は51CTO.COMで複製されています。侵害がある場合は、admin@php.cn までご連絡ください。

私のコラムに新しいかもしれない人のために、具体化されたAI、AI推論、AIのハイテクブレークスルー、AIの迅速なエンジニアリング、AIのトレーニング、AIのフィールディングなどのトピックなど、全面的なAIの最新の進歩を広く探求します。

ヨーロッパのAI大陸行動計画：GigaFactories、Data Labs、Green AIApr 10, 2025 am 11:21 AM

ヨーロッパの野心的なAI大陸行動計画は、人工知能のグローバルリーダーとしてEUを確立することを目指しています。重要な要素は、AI GigaFactoriesのネットワークの作成であり、それぞれが約100,000の高度なAIチップを収容しています。

Microsoftの簡単なエージェントストーリーは、より多くのファンを作成するのに十分ですか？Apr 10, 2025 am 11:20 AM

AIエージェントアプリケーションに対するMicrosoftの統一アプローチ：企業の明確な勝利新しいAIエージェント機能に関するマイクロソフトの最近の発表は、その明確で統一されたプレゼンテーションに感銘を受けました。 TEで行き詰まった多くのハイテクアナウンスとは異なり

従業員へのAI戦略の販売：Shopify CEOのマニフェストApr 10, 2025 am 11:19 AM

Shopify CEOのTobiLütkeの最近のメモは、AIの能力がすべての従業員にとって基本的な期待であると大胆に宣言し、会社内の重大な文化的変化を示しています。これはつかの間の傾向ではありません。これは、pに統合された新しい運用パラダイムです

IBMは、完全なAI統合でZ17メインフレームを起動しますApr 10, 2025 am 11:18 AM

IBMのZ17メインフレーム：AIを強化した事業運営の統合先月、IBMのニューヨーク本社で、Z17の機能のプレビューを受け取りました。 Z16の成功に基づいて構築（2022年に開始され、持続的な収益の成長の実証

5 chatgptプロンプトは他の人に依存して停止し、自分を完全に信頼するApr 10, 2025 am 11:17 AM

揺るぎない自信のロックを解除し、外部検証の必要性を排除します！これらの5つのCHATGPTプロンプトは、完全な自立と自己認識の変革的な変化に向けて導きます。ブラケットをコピー、貼り付け、カスタマイズするだけです

AIはあなたの心に危険なほど似ていますApr 10, 2025 am 11:16 AM

人工知能のセキュリティおよび研究会社であるAnthropicによる最近の[研究]は、これらの複雑なプロセスについての真実を明らかにし始め、私たち自身の認知領域に不穏に似た複雑さを示しています。自然知能と人工知能は、私たちが思っているよりも似ているかもしれません。内部スヌーピング：人類の解釈可能性研究人類によって行われた研究からの新しい発見は、AIの内部コンピューティングをリバースエンジニアリングすることを目的とする機械的解釈可能性の分野の大きな進歩を表しています。AIが何をするかを観察するだけでなく、人工ニューロンレベルでそれがどのように行うかを理解します。誰かが特定のオブジェクトを見たり、特定のアイデアについて考えたりしたときに、どのニューロンが発射するかを描くことによって脳を理解しようとすることを想像してください。 a

Dragonwingは、QualcommのEdge Momentumを紹介していますApr 10, 2025 am 11:14 AM

Qualcomm's DragonWing：企業とインフラストラクチャへの戦略的な飛躍 Qualcommは、新しいDragonwingブランドで世界的に企業やインフラ市場をターゲットにして、モバイルを超えてリーチを積極的に拡大しています。これは単なるレブランではありません

See all articles

ホットAIツール

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

脱衣画像を無料で

Clothoff.io

AI衣類リムーバー

AI Hentai Generator

AIヘンタイを無料で生成します。

ホットツール

Safe Exam Browser

Safe Exam Browser は、オンライン試験を安全に受験するための安全なブラウザ環境です。このソフトウェアは、あらゆるコンピュータを安全なワークステーションに変えます。あらゆるユーティリティへのアクセスを制御し、学生が無許可のリソースを使用するのを防ぎます。

メモ帳++7.3.1

使いやすく無料のコードエディター

ドリームウィーバー CS6

ビジュアル Web 開発ツール

MinGW - Minimalist GNU for Windows

このプロジェクトは osdn.net/projects/mingw に移行中です。引き続きそこでフォローしていただけます。 MinGW: GNU Compiler Collection (GCC) のネイティブ Windows ポートであり、ネイティブ Windows アプリケーションを構築するための自由に配布可能なインポートライブラリとヘッダーファイルであり、C99 機能をサポートする MSVC ランタイムの拡張機能が含まれています。すべての MinGW ソフトウェアは 64 ビット Windows プラットフォームで実行できます。