視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています
大きな推奨事項:Visual-RFT-Visual Language Modelsを強化するための視覚的強化と微調整オープンソースプロジェクト!
AIXIVコラムは、世界のトップAI研究に焦点を当て続けており、2,000を超える学術および技術記事を発表しています。あなたの傑出した成果を共有するための貢献へようこそ!提出メール:liyazhou@jiqizhixin.com;
Visual-RFT(Visual Renforcement微調整)プロジェクトは、視覚言語の大きなモデル(LVLM)に対するルールの報酬に基づいて、補強学習と強化微調整(RFT)パラダイムを正常に適用し、テキスト、数学、その他の分野に限定されている以前の方法の制限を突破します。 Visual-RFTは、視覚的なサブカテゴリ化やオブジェクト検出などのタスクの特定のルール報酬を設計することにより、LVLMトレーニングの新しいアイデアを提供します!
図1は、Visual-RFTの強力な一般化能力を示しています。モデルでは、視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています内の特定のポケモンを正確に識別し、その座標を見つけるために、少量のデータのみが必要です。
図1。Visual-RFTは、モデルのパフォーマンスを大幅に改善するために、10〜1000個のデータのみで、微調整された微調整をマルチモーダルに拡張します。
RFTからVisual-RFTへ:マルチモーダル分野での補強学習のブレークスルー
OpenAIの強化された微調整技術により、モデルの機能移行は、少数のサンプルだけで達成できます。 DeepSeek-R1は、その強力な推論能力が検証可能な報酬に基づいた強化学習戦略に起因することを明らかにしています。ただし、この戦略は、以前は主にテキストや数学などの分野で使用されていました。 Visual-RFTは、この戦略を視野に拡張しました。検証可能なルールの報酬を構築することにより、視野での従来の方法の制限を解決し、効率的で高度に一般化された視覚的理解と推論を達成しました。
従来の視覚命令微調整(SFT)には大量のデータが必要であり、Visual-RFTの小さなサンプル学習能力により、データ不足シナリオではより有利になります。
Visual-RFTの一般化能力を検証するために、研究チームは、オブジェクトの検出、分類、接地などの複数の視覚タスクのテストを実施しました。結果は、Visual-RFTがオープンな語彙、小規模なサンプル学習、その他の設定の下で大幅なパフォーマンスの改善を達成できることを示しており、SFTメソッドよりも優れています。特に推論の位置決めタスクでは、Visual-RFTは優れた視覚的推論能力を示しています。 (詳細については、論文を参照してください)
図2。視覚RFTは、複数の視覚タスクでSFTを大幅に上回ります。
図3。Visual-RFTフレームワーク図、IOUおよびCLSの報酬と強化学習戦略を使用したモデルパラメーターの更新。
研究チームは、検出および接地タスクのためにIOUベースの検証可能な報酬を使用し、分類タスクの分類正しさに基づいてCLSの報酬を使用しました。 (図3に示すように)
図4。推論的な位置決めの結果は、視覚RFTがSFTを上回ってオブジェクトをより正確に見つけることを示しています。
図5。推論的な細粒分類の結果は、視覚RFTがSFTを上回ってオブジェクトをより正確に見つけることを示しています。
図4と図5は、モデルの出力結果を示しています。
Visual-RFT実験結果
QWEN2-VL 2B/7Bモデルに基づいて、Visual-RFTは、オープンオブジェクト検出、小さなサンプル検出、細粒分類、および推論配置タスクでSFTを包括的に上回ります。実験データは、ココやLVIなどの一般的なシーンや、インターネット漫画のキャラクターなどのオープンシーンをカバーしています。わずかなデータを使用すると、Visual-RFTは機能の移行を実現し、優れたパフォーマンスと堅牢性を示します。
図5。いくつかの実験結果は、視覚RFTがSFTを大幅に上回ることを示しています。
Visual-RFTはオープンソースです!
Visual-RFTプロジェクトはオープンソースであり、トレーニング、評価コード、データが含まれています。参加してください!
プロジェクトアドレス: https://www.php.cn/link/ec56522bc9c2e15be17d11962eeec453
以上が視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されていますの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

ChatGptはアクセスできませんか?この記事では、さまざまな実用的なソリューションを提供しています!多くのユーザーは、ChatGPTを毎日使用する場合、アクセス不能や応答が遅いなどの問題に遭遇する可能性があります。この記事では、さまざまな状況に基づいてこれらの問題を段階的に解決するように導きます。 ChatGPTのアクセス不能性と予備的なトラブルシューティングの原因 まず、問題がOpenaiサーバー側にあるのか、ユーザー自身のネットワークまたはデバイスの問題にあるのかを判断する必要があります。 以下の手順に従って、トラブルシューティングしてください。 ステップ1:OpenAIの公式ステータスを確認してください OpenAIステータスページ(status.openai.com)にアクセスして、ChatGPTサービスが正常に実行されているかどうかを確認してください。赤または黄色のアラームが表示されている場合、それは開くことを意味します

2025年5月10日、MIT物理学者のMax Tegmarkは、AI Labsが人工的なスーパーインテリジェンスを解放する前にOppenheimerの三位一体計算をエミュレートすべきだとGuardianに語った。 「私の評価では、「コンプトン定数」、競争が

AI Music Creation Technologyは、1日ごとに変化しています。この記事では、ChatGPTなどのAIモデルを例として使用して、AIを使用して音楽の作成を支援し、実際のケースで説明する方法を詳細に説明します。 Sunoai、Hugging Face、PythonのMusic21 Libraryを通じて音楽を作成する方法を紹介します。 これらのテクノロジーを使用すると、誰もがオリジナルの音楽を簡単に作成できます。ただし、AIに生成されたコンテンツの著作権問題は無視できないことに注意する必要があります。使用する際には注意する必要があります。 音楽分野でのAIの無限の可能性を一緒に探りましょう! Openaiの最新のAIエージェント「Openai Deep Research」が紹介します。 [chatgpt] ope

ChATGPT-4の出現により、AIアプリケーションの可能性が大幅に拡大しました。 GPT-3.5と比較して、CHATGPT-4は大幅に改善されました。強力なコンテキスト理解能力を備えており、画像を認識して生成することもできます。普遍的なAIアシスタントです。それは、ビジネス効率の改善や創造の支援など、多くの分野で大きな可能性を示しています。ただし、同時に、その使用における予防策にも注意を払わなければなりません。 この記事では、ChATGPT-4の特性を詳細に説明し、さまざまなシナリオの効果的な使用方法を紹介します。この記事には、最新のAIテクノロジーを最大限に活用するためのスキルが含まれています。参照してください。 Openaiの最新のAIエージェント、「Openai Deep Research」の詳細については、以下のリンクをクリックしてください

ChatGPTアプリ:AIアシスタントで創造性を解き放つ!初心者向けガイド ChatGPTアプリは、文章作成、翻訳、質問応答など、多様なタスクに対応する革新的なAIアシスタントです。創作活動や情報収集にも役立つ、無限の可能性を秘めたツールです。 この記事では、ChatGPTスマホアプリのインストール方法から、音声入力機能やプラグインといったアプリならではの機能、そしてアプリ利用上の注意点まで、初心者にも分かりやすく解説します。プラグインの制限やデバイス間の設定同期についてもしっかりと触れていきま

Chatgpt中国語版:中国語のAIの対話の新しい体験のロックを解除する ChatGptは世界中で人気がありますが、中国語版も提供していることをご存知ですか?この強力なAIツールは、毎日の会話をサポートするだけでなく、プロのコンテンツを処理し、簡素化された伝統的な中国語と互換性があります。中国のユーザーであろうと、中国語を学んでいる友人であろうと、あなたはそれから利益を得ることができます。 この記事では、アカウント設定、中国語の迅速な単語入力、フィルターの使用、さまざまなパッケージの選択を含むChatGpt中国語のバージョンの使用方法を詳細に紹介し、潜在的なリスクと対応戦略を分析します。さらに、ChatGpt中国語版を他の中国のAIツールと比較して、その利点とアプリケーションシナリオをよりよく理解するのに役立ちます。 Openaiの最新のAIインテリジェンス

これらは、生成AIの分野で次の飛躍と考えることができ、ChatGptやその他の大規模なモデルのチャットボットを提供しました。単に質問に答えたり情報を生成したりするのではなく、彼らは私たちに代わって行動を起こすことができます。

ChatGPTを活用した効率的な複数アカウント管理術|ビジネスとプライベートの使い分けも徹底解説! 様々な場面で活用されているChatGPTですが、複数アカウントの管理に頭を悩ませている方もいるのではないでしょうか。この記事では、ChatGPTの複数アカウント作成方法、利用上の注意点、そして安全かつ効率的な運用方法を詳しく解説します。ビジネス利用とプライベート利用の使い分け、OpenAIの利用規約遵守といった重要な点にも触れ、複数アカウントを安全に活用するためのガイドを提供します。 OpenAI


ホットAIツール

Undresser.AI Undress
リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover
写真から衣服を削除するオンライン AI ツール。

Undress AI Tool
脱衣画像を無料で

Clothoff.io
AI衣類リムーバー

Video Face Swap
完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

人気の記事

ホットツール

SublimeText3 英語版
推奨: Win バージョン、コードプロンプトをサポート!

PhpStorm Mac バージョン
最新(2018.2.1)のプロフェッショナル向けPHP統合開発ツール

SAP NetWeaver Server Adapter for Eclipse
Eclipse を SAP NetWeaver アプリケーション サーバーと統合します。

Safe Exam Browser
Safe Exam Browser は、オンライン試験を安全に受験するための安全なブラウザ環境です。このソフトウェアは、あらゆるコンピュータを安全なワークステーションに変えます。あらゆるユーティリティへのアクセスを制御し、学生が無許可のリソースを使用するのを防ぎます。

WebStorm Mac版
便利なJavaScript開発ツール
