検索
ホームページテクノロジー周辺機器AI復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

最近、OpenAI のビデオ生成モデル Sora が人気となり、生成 AI モデルのマルチモーダル機能が再び注目を集めています。

実世界は本質的にマルチモーダルであり、生物は視覚、言語、聴覚、触覚などのさまざまなチャネルを通じて情報を感知し、交換します。マルチモーダル システム開発の有望な方向性の 1 つは、LLM のマルチモーダル認識機能を強化することです。これには、主にマルチモーダル エンコーダーと言語モデルの統合が含まれます。これにより、エンコーダーがさまざまなモダリティにわたって情報を処理し、LLM のテキスト処理能力を活用して一貫した応答を生成できるようになります。

ただし、この戦略はテキスト生成にのみ適用され、マルチモーダル出力には適用されません。一部の先駆的な研究では、言語モデルにおけるマルチモーダルな理解と生成の達成において大きな進歩を遂げていますが、これらのモデルは画像や音声などの単一の非テキスト モダリティに限定されています。

上記の問題を解決するために、復旦大学の Qiu Xipeng のチームは、マルチモーダル アート プロジェクション (MAP) および上海人工知能研究所の研究者とともに、マルチモーダル言語モデルを提案しました。 AnyGPT と呼ばれるこのモデルは、モダリティの任意の組み合わせでさまざまなモダリティの内容を理解し、推論することができます。具体的には、AnyGPT はテキスト、音声、画像、音楽などの複数のモダリティが絡み合った命令を理解し、適切なマルチモーダルの組み合わせを巧みに選択して応答することができます。

たとえば、音声プロンプトが与えられると、AnyGPT は音声、画像、音楽の形式で包括的な応答を生成できます。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

テキスト画像の形式でプロンプトが与えられると、AnyGPT はプロンプトの要件に従って音楽を生成できます。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。


  • #論文アドレス: https://arxiv.org/pdf/2402.12226.pdf
  • プロジェクトのホームページ: https://junzhan2000.github.io/AnyGPT.github.io/

#メソッドの紹介

AnyGPT は離散表現を利用して、音声、テキスト、画像、音楽などのさまざまなモダリティを均一に処理します。

あらゆるモダリティからあらゆるモダリティへの生成タスクを完了するために、本研究は均一に学習できる包括的なフレームワークを提案します。以下の図 1 に示すように、フレームワークは次の 3 つの主要コンポーネントで構成されます。

  • マルチモーダル トークナイザー
  • バックボーンとしてのマルチモーダルネットワークの言語モデル
  • マルチモーダル デトークナイザー

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

その中で、トークナイザーは連続的な非テキスト モダリティを離散トークンに変換し、その後、それらをマルチモーダル インターリーブ シーケンスに配置します。次に、言語モデルは、次のトークン予測トレーニング ターゲットを使用してトレーニングされます。推論中、マルチモーダル トークンは、関連するデトークナイザーによってデコードされて元の表現に戻されます。生成の品質を高めるために、音声クローン作成や画像の超解像度などのアプリケーションを含む、生成された結果を後処理するマルチモーダル拡張モジュールを導入できます。

AnyGPT は、現在の大規模言語モデル (LLM) アーキテクチャやトレーニング パラダイムを変更することなく、安定してトレーニングできます。代わりに、データレベルの前処理に完全に依存し、新しい言語を追加するのと同じように、新しいモダリティを LLM にシームレスに統合できます。

この研究における主な課題は、マルチモーダル インターリーブ命令追跡データが欠如していることです。マルチモーダル アライメントの事前トレーニングを完了するために、研究チームは生成モデルを使用して、最初の大規模な「任意対任意」マルチモーダル命令データ セットである AnyInstruct-108k を合成しました。これは、さまざまなモダリティと複雑に絡み合う 108k のマルチターン ダイアログ サンプルで構成されており、モデルがマルチモーダルの入力と出力のあらゆる組み合わせを処理できるようになります。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

これらのデータは通常、正確に表現するために大量のビットを必要とし、結果として長いシーケンスになります。シーケンスの長さに応じて計算の複雑さが指数関数的に増加するため、言語モデルでは特に要求が厳しくなります。 . レベルが上がりました。この問題を解決するために、本研究では意味情報モデリングと知覚情報モデリングを含む 2 段階の高忠実度生成フレームワークを採用しています。まず、言語モデルは、意味レベルで融合および調整されたコンテンツを生成するという役割を果たします。次に、非自己回帰モデルは、マルチモーダル セマンティック トークンを知覚レベルで忠実度の高いマルチモーダル コンテンツに変換し、パフォーマンスと効率のバランスをとります。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

実験

実験結果は、AnyGPT がすべてのモダリティで専用モデルと同等のパフォーマンスを達成しながら、任意のモダリティ間の対話タスクを完了できることを示し、離散表現が言語モデル内の複数のモダリティを効果的かつ便利に統合できることを証明しています。

この研究では、すべてのモダリティにわたるマルチモーダルの理解と生成タスクをカバーする、事前トレーニングされたベース AnyGPT の基本機能を評価します。この評価は、事前トレーニング プロセス中に異なるモダリティ間の一貫性をテストすることを目的としています。具体的には、各モダリティのテキストから X へのタスクと X からテキストへのタスクがテストされます (X は画像、音楽、音声)。

実際のシナリオをシミュレートするために、すべての評価はゼロサンプル モードで実行されます。これは、AnyGPT が評価プロセス中にダウンストリーム トレーニング サンプルの微調整や事前トレーニングを行わないことを意味します。この困難な評価設定では、モデルを未知のテスト分布に一般化する必要があります。

評価結果は、AnyGPT が一般的なマルチモーダル言語モデルとして、さまざまなマルチモーダルの理解および生成タスクにおいて賞賛に値するパフォーマンスを達成することを示しています。

#画像

この研究では、画像記述タスクにおける AnyGPT の画像理解能力を評価しました。表 2 に示します。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。#テキストから画像への生成タスクの結果を表 3 に示します。

音声復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。この研究では、LibriSpeech データセットのテストサブセットの単語誤り率を計算しました。 (WER) を使用して、自動音声認識 (ASR) タスクにおける AnyGPT のパフォーマンスを評価し、Wav2vec 2.0 および Whisper Large V2 をベースラインとして使用しました。評価結果を表 5 に示します。 #######################################音楽##########

##この研究では、CLAP_score スコアを客観的な指標として使用して、生成された音楽とテキストの説明の類似性を測定することにより、MusicCaps ベンチマークでの音楽理解および生成タスクにおける AnyGPT のパフォーマンスを評価しました。評価結果は表 6 に示されています。見せる。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。興味のある読者は、論文の原文を読んで研究内容をさらに詳しく知ることができます。

復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。

以上が復旦大学などは、画像、音楽、テキスト、音声を含むあらゆるモーダル入出力である AnyGPT をリリースしました。の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明
この記事は51CTO.COMで複製されています。侵害がある場合は、admin@php.cn までご連絡ください。
AIのスキルギャップは、サプライチェーンのダウンを遅くしていますAIのスキルギャップは、サプライチェーンのダウンを遅くしていますApr 26, 2025 am 11:13 AM

「AI-Ready労働力」という用語は頻繁に使用されますが、サプライチェーン業界ではどういう意味ですか? サプライチェーン管理協会(ASCM)のCEOであるAbe Eshkenaziによると、批評家ができる専門家を意味します

1つの会社がAIを永遠に変えるために静かに取り組んでいる方法1つの会社がAIを永遠に変えるために静かに取り組んでいる方法Apr 26, 2025 am 11:12 AM

分散型AI革命は静かに勢いを増しています。 今週の金曜日、テキサス州オースティンでは、ビテンサーのエンドゲームサミットは極めて重要な瞬間を示し、理論から実用的な応用に分散したAI(DEAI)を移行します。 派手なコマーシャルとは異なり

Nvidiaは、AIエージェント開発を合理化するためにNEMOマイクロサービスをリリースしますNvidiaは、AIエージェント開発を合理化するためにNEMOマイクロサービスをリリースしますApr 26, 2025 am 11:11 AM

エンタープライズAIはデータ統合の課題に直面しています エンタープライズAIの適用は、ビジネスデータを継続的に学習することで正確性と実用性を維持できるシステムを構築する大きな課題に直面しています。 NEMOマイクロサービスは、NVIDIAが「データフライホイール」と呼んでいるものを作成することにより、この問題を解決し、AIシステムがエンタープライズ情報とユーザーインタラクションへの継続的な露出を通じて関連性を維持できるようにします。 この新しく発売されたツールキットには、5つの重要なマイクロサービスが含まれています。 NEMOカスタマイザーは、より高いトレーニングスループットを備えた大規模な言語モデルの微調整を処理します。 NEMO評価者は、カスタムベンチマークのAIモデルの簡素化された評価を提供します。 Nemo Guardrailsは、コンプライアンスと適切性を維持するためにセキュリティ管理を実装しています

aiは芸術とデザインの未来のために新しい絵を描きますaiは芸術とデザインの未来のために新しい絵を描きますApr 26, 2025 am 11:10 AM

AI:芸術とデザインの未来 人工知能(AI)は、前例のない方法で芸術とデザインの分野を変えており、その影響はもはやアマチュアに限定されませんが、より深く影響を与えています。 AIによって生成されたアートワークとデザインスキームは、広告、ソーシャルメディアの画像生成、Webデザインなど、多くのトランザクションデザインアクティビティで従来の素材画像とデザイナーに迅速に置き換えられています。 ただし、プロのアーティストやデザイナーもAIの実用的な価値を見つけています。 AIを補助ツールとして使用して、新しい美的可能性を探求し、さまざまなスタイルをブレンドし、新しい視覚効果を作成します。 AIは、アーティストやデザイナーが繰り返しタスクを自動化し、さまざまなデザイン要素を提案し、創造的な入力を提供するのを支援します。 AIはスタイル転送をサポートします。これは、画像のスタイルを適用することです

エージェントAIとのズームがどのように革命を起こしているか:会議からマイルストーンまでエージェントAIとのズームがどのように革命を起こしているか:会議からマイルストーンまでApr 26, 2025 am 11:09 AM

最初はビデオ会議プラットフォームで知られていたZoomは、エージェントAIの革新的な使用で職場革命をリードしています。 ZoomのCTOであるXD Huangとの最近の会話は、同社の野心的なビジョンを明らかにしました。 エージェントAIの定義 huang d

大学に対する実存的な脅威大学に対する実存的な脅威Apr 26, 2025 am 11:08 AM

AIは教育に革命をもたらしますか? この質問は、教育者と利害関係者の間で深刻な反省を促しています。 AIの教育への統合は、機会と課題の両方をもたらします。 Tech Edvocate NotesのMatthew Lynch、Universitとして

プロトタイプ:アメリカの科学者は海外の仕事を探していますプロトタイプ:アメリカの科学者は海外の仕事を探していますApr 26, 2025 am 11:07 AM

米国における科学的研究と技術の開発は、おそらく予算削減のために課題に直面する可能性があります。 Natureによると、海外の雇用を申請するアメリカの科学者の数は、2024年の同じ期間と比較して、2025年1月から3月まで32%増加しました。以前の世論調査では、調査した研究者の75%がヨーロッパとカナダでの仕事の検索を検討していることが示されました。 NIHとNSFの助成金は過去数か月で終了し、NIHの新しい助成金は今年約23億ドル減少し、3分の1近く減少しました。リークされた予算の提案は、トランプ政権が科学機関の予算を急激に削減していることを検討しており、最大50%の削減の可能性があることを示しています。 基礎研究の分野での混乱は、米国の主要な利点の1つである海外の才能を引き付けることにも影響を与えています。 35

オープンAIの最新のGPT 4.1ファミリ - 分析VidhyaオープンAIの最新のGPT 4.1ファミリ - 分析VidhyaApr 26, 2025 am 10:19 AM

Openaiは、強力なGPT-4.1シリーズを発表しました。実際のアプリケーション向けに設計された3つの高度な言語モデルのファミリー。 この大幅な飛躍は、より速い応答時間、理解の強化、およびTと比較した大幅に削減されたコストを提供します

See all articles

ホットAIツール

Undresser.AI Undress

Undresser.AI Undress

リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover

AI Clothes Remover

写真から衣服を削除するオンライン AI ツール。

Undress AI Tool

Undress AI Tool

脱衣画像を無料で

Clothoff.io

Clothoff.io

AI衣類リムーバー

Video Face Swap

Video Face Swap

完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

ホットツール

EditPlus 中国語クラック版

EditPlus 中国語クラック版

サイズが小さく、構文の強調表示、コード プロンプト機能はサポートされていません

MantisBT

MantisBT

Mantis は、製品の欠陥追跡を支援するために設計された、導入が簡単な Web ベースの欠陥追跡ツールです。 PHP、MySQL、Web サーバーが必要です。デモおよびホスティング サービスをチェックしてください。

SAP NetWeaver Server Adapter for Eclipse

SAP NetWeaver Server Adapter for Eclipse

Eclipse を SAP NetWeaver アプリケーション サーバーと統合します。

mPDF

mPDF

mPDF は、UTF-8 でエンコードされた HTML から PDF ファイルを生成できる PHP ライブラリです。オリジナルの作者である Ian Back は、Web サイトから「オンザフライ」で PDF ファイルを出力し、さまざまな言語を処理するために mPDF を作成しました。 HTML2FPDF などのオリジナルのスクリプトよりも遅く、Unicode フォントを使用すると生成されるファイルが大きくなりますが、CSS スタイルなどをサポートし、多くの機能強化が施されています。 RTL (アラビア語とヘブライ語) や CJK (中国語、日本語、韓国語) を含むほぼすべての言語をサポートします。ネストされたブロックレベル要素 (P、DIV など) をサポートします。

MinGW - Minimalist GNU for Windows

MinGW - Minimalist GNU for Windows

このプロジェクトは osdn.net/projects/mingw に移行中です。引き続きそこでフォローしていただけます。 MinGW: GNU Compiler Collection (GCC) のネイティブ Windows ポートであり、ネイティブ Windows アプリケーションを構築するための自由に配布可能なインポート ライブラリとヘッダー ファイルであり、C99 機能をサポートする MSVC ランタイムの拡張機能が含まれています。すべての MinGW ソフトウェアは 64 ビット Windows プラットフォームで実行できます。