ホームページ > 記事 > テクノロジー周辺機器 > ドキュメント内の単語が多ければ多いほど、モデルはより興奮します。 KOSMOS-2.5: 「テキスト密度の高い画像」を読み取るためのマルチモーダル大規模言語モデル
現在の明らかな傾向は、印象的な言語出力を生成できる数百億、数千億のパラメーターを備えた、より大規模で複雑なモデルを構築する方向です。
#ただし、既存の大規模言語モデルは主に文字情報に集中し、視覚情報を理解できない。 マルチモーダル大規模言語モデル (MLLM) の分野の進歩は、この制限に対処することを目的としています。MLLM は、視覚情報とテキスト情報を単一の Transformer ベースのモデルに融合し、モデルを次のようにします。両方のモダリティに基づいてコンテンツを学習および生成できます。 MLLM は、自然な画像理解やテキスト画像理解など、さまざまな実用的なアプリケーションでの可能性を示しています。これらのモデルは、マルチモーダルな問題を処理するための共通インターフェイスとして言語モデリングを活用し、テキストおよび視覚的な入力に基づいて応答を処理および生成できるようにします。ただし、現在は主に自然画像用の低解像度 MLLM に重点が置かれており、テキストに関する研究は比較的少ないです。 -濃密な画像。したがって、テキスト画像をトレーニングプロセスに組み込んでモデルを開発することにより、大規模なマルチモーダル事前トレーニングを活用してテキスト画像を処理することがMLLM研究の重要な方向性となっています テキストと視覚情報に基づいて、高解像度のテキスト密度の高い画像を含むマルチモーダル アプリケーションの新たな可能性を開くことができます。 写真論文アドレス: https://arxiv.org/abs/2309.11419##KOSMOS-2.5 は、テキスト密度の高い画像に基づくマルチモーダル大規模言語モデルです。KOSMOS-2 に基づいて開発され、テキスト密度の高い画像のマルチモーダルな読み取りおよび理解機能を強調しています (マルチモーダル読み書きモデル)。
#提案されたモデルは、テキスト中心の画像を理解する際の優れたパフォーマンスを強調し、視覚とテキストの間のギャップを橋渡しします 同時に、これは、以前のエンコーダ/デコーダ アーキテクチャから純粋なデコーダ アーキテクチャへのタスク パラダイムの進化でもあります。 KOSMOS-2.5 は、テキストリッチな画像をターゲットとします。シームレスなビジュアルおよびテキスト データ処理を可能にし、画像の内容を理解し、構造化されたテキストの説明を生成します。 図 1: KOSMOS-2.5 の概要KOSMOS-2.5 はマルチモーダル モデルです図 1 に示すように、統合フレームワークを使用して 2 つの密接に関連するタスクを処理することを目的としています。
最初のタスクには、空間認識テキスト ブロックの生成が含まれます。つまり、コンテンツと座標フレームを同時に生成します。テキストブロックの。 書き換える必要がある内容は次のとおりです。 最初のタスクには、空間認識テキスト ブロックの生成が含まれます。つまり、テキスト ブロックと座標ボックスのコンテンツを同時に生成します。 #2 番目のタスクには、Markdown 形式の使用が含まれます。構造化テキスト出力を生成し、さまざまなスタイルと構造をキャプチャします。 図 2: KOSMOS-2.5 アーキテクチャ図図 2 に示すように、どちらのタスクも共有の Transformer アーキテクチャとタスク固有のプロンプトを使用します。
KOSMOS-2.5 は ViT (Vision Transformer) に基づいています。 ) ビジョン エンコーダーは、リサンプリング モジュールを介して接続された、Transformer アーキテクチャに基づくデコーダーと結合されます。#図 3: トレーニング前のデータ セット
このモデルをトレーニングするために、作成者は図 3 に示すように、データ セットのサイズは 3 億 2,440 万個です。
#図 4: 境界ボックスを使用したテキスト行のトレーニング サンプルの例
図 5: マークダウン形式のトレーニング サンプルの例
このデータ セットにはさまざまなデータが含まれていますタイプ 境界ボックスを含むテキスト行とマークダウン形式のプレーンテキストを含むテキスト密度の高い画像。図 4 と図 5 は、トレーニング サンプルの視覚化例です。このマルチタスク トレーニング方法は、KOSMOS-2.5 の全体的なマルチモーダル機能を向上させます
[図 6] エンドツーエンドのドキュメントレベルのテキスト認識実験
図 7: 画像から Markdown 形式のテキストを生成する実験
図 6 と 7 に示すように、KOSMOS-2.5 は、エンドツーエンドのドキュメントレベルのテキスト認識と画像からの Markdown 形式のテキストの生成という 2 つのタスクで評価されます。 。
KOSMOS-2.5 は、実験結果が示すように、テキスト中心の画像タスクの処理に優れています。
図 8: KOSMOS-2.5の入出力サンプル表示
KOSMOS-2.5は、数ショット学習およびゼロショット学習シナリオで有望な機能を示しており、実用的な多目的ツールになります。テキストの多い画像を処理するアプリケーション。これは、テキストの多い画像を効果的に処理し、数回のショットとゼロショットの学習状況の両方で有望な機能を発揮できる多用途ツールと考えることができます。チューニングは、モデルの幅広い適用能力を実現する有望な方法です。
より広範な研究分野において、重要な方向性は、モデル パラメーターを拡張する機能をさらに開発することにあります。
タスクの範囲と複雑さが拡大し続ける中、テキスト集約型のマルチモーダル モデルの開発には、大量のデータを処理できるようにモデルをスケーリングすることが重要です。
最終的な目標は、ビジュアル データとテキスト データを効果的に解釈し、テキストを多用するマルチモーダル タスク全体にうまく汎用化できるモデルを開発することです。
内容を書き換える場合は中国語に書き直す必要があり、元の文章は表示する必要はありません
https://arxiv.org/abs/ 2309.11419
以上がドキュメント内の単語が多ければ多いほど、モデルはより興奮します。 KOSMOS-2.5: 「テキスト密度の高い画像」を読み取るためのマルチモーダル大規模言語モデルの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。