視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています
大きな推奨事項:Visual-RFT-Visual Language Modelsを強化するための視覚的強化と微調整オープンソースプロジェクト!
AIXIVコラムは、世界のトップAI研究に焦点を当て続けており、2,000を超える学術および技術記事を発表しています。あなたの傑出した成果を共有するための貢献へようこそ!提出メール:liyazhou@jiqizhixin.com;
Visual-RFT(Visual Renforcement微調整)プロジェクトは、視覚言語の大きなモデル(LVLM)に対するルールの報酬に基づいて、補強学習と強化微調整(RFT)パラダイムを正常に適用し、テキスト、数学、その他の分野に限定されている以前の方法の制限を突破します。 Visual-RFTは、視覚的なサブカテゴリ化やオブジェクト検出などのタスクの特定のルール報酬を設計することにより、LVLMトレーニングの新しいアイデアを提供します!
図1は、Visual-RFTの強力な一般化能力を示しています。モデルでは、視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されています内の特定のポケモンを正確に識別し、その座標を見つけるために、少量のデータのみが必要です。
図1。Visual-RFTは、モデルのパフォーマンスを大幅に改善するために、10〜1000個のデータのみで、微調整された微調整をマルチモーダルに拡張します。
RFTからVisual-RFTへ:マルチモーダル分野での補強学習のブレークスルー
OpenAIの強化された微調整技術により、モデルの機能移行は、少数のサンプルだけで達成できます。 DeepSeek-R1は、その強力な推論能力が検証可能な報酬に基づいた強化学習戦略に起因することを明らかにしています。ただし、この戦略は、以前は主にテキストや数学などの分野で使用されていました。 Visual-RFTは、この戦略を視野に拡張しました。検証可能なルールの報酬を構築することにより、視野での従来の方法の制限を解決し、効率的で高度に一般化された視覚的理解と推論を達成しました。
従来の視覚命令微調整(SFT)には大量のデータが必要であり、Visual-RFTの小さなサンプル学習能力により、データ不足シナリオではより有利になります。
Visual-RFTの一般化能力を検証するために、研究チームは、オブジェクトの検出、分類、接地などの複数の視覚タスクのテストを実施しました。結果は、Visual-RFTがオープンな語彙、小規模なサンプル学習、その他の設定の下で大幅なパフォーマンスの改善を達成できることを示しており、SFTメソッドよりも優れています。特に推論の位置決めタスクでは、Visual-RFTは優れた視覚的推論能力を示しています。 (詳細については、論文を参照してください)
図2。視覚RFTは、複数の視覚タスクでSFTを大幅に上回ります。
図3。Visual-RFTフレームワーク図、IOUおよびCLSの報酬と強化学習戦略を使用したモデルパラメーターの更新。
研究チームは、検出および接地タスクのためにIOUベースの検証可能な報酬を使用し、分類タスクの分類正しさに基づいてCLSの報酬を使用しました。 (図3に示すように)
図4。推論的な位置決めの結果は、視覚RFTがSFTを上回ってオブジェクトをより正確に見つけることを示しています。
図5。推論的な細粒分類の結果は、視覚RFTがSFTを上回ってオブジェクトをより正確に見つけることを示しています。
図4と図5は、モデルの出力結果を示しています。
Visual-RFT実験結果
QWEN2-VL 2B/7Bモデルに基づいて、Visual-RFTは、オープンオブジェクト検出、小さなサンプル検出、細粒分類、および推論配置タスクでSFTを包括的に上回ります。実験データは、ココやLVIなどの一般的なシーンや、インターネット漫画のキャラクターなどのオープンシーンをカバーしています。わずかなデータを使用すると、Visual-RFTは機能の移行を実現し、優れたパフォーマンスと堅牢性を示します。
図5。いくつかの実験結果は、視覚RFTがSFTを大幅に上回ることを示しています。
Visual-RFTはオープンソースです!
Visual-RFTプロジェクトはオープンソースであり、トレーニング、評価コード、データが含まれています。参加してください!
プロジェクトアドレス: https://www.php.cn/link/ec56522bc9c2e15be17d11962eeec453
以上が視覚強化微調整! DeepSeek R1テクノロジーはマルチモーダルフィールドに正常に移行されており、ソースに完全に開放されていますの詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

2008年以来、私は共有ライドバンを擁護しました。これは、「Robotjitney」と呼ばれる「後に「Vansit」と呼ばれ、都市交通の未来として擁護しました。 私はこれらの車両を21世紀の次世代トランジットソリューション、スルパとして予見します

チェックアウトエクスペリエンスに革命をもたらす Sam's Clubの革新的な「Just Go」システムは、既存のAIを搭載した「スキャン&ゴー」テクノロジーに基づいて構築され、ショッピング旅行中にメンバーがサムズクラブアプリを介して購入をスキャンできるようになりました。

GTC 2025でのNvidiaの強化された予測可能性と新製品のラインナップ AIインフラストラクチャの重要なプレーヤーであるNvidiaは、クライアントの予測可能性の向上に焦点を当てています。 これには、一貫した製品配信、パフォーマンスの期待を満たすこと、および

GoogleのGemma 2:強力で効率的な言語モデル 効率とパフォーマンスで祝われるGoogleのGemmaファミリーは、Gemma 2の到着とともに拡大しました。この最新リリースは2つのモデルで構成されています。

データエピソードを率いるこの主要なのは、主要なデータサイエンティスト、天体物理学者、TEDXスピーカーであるカークボーン博士を特徴としています。 ビッグデータ、AI、および機械学習の有名な専門家であるボルネ博士は、現在の状態と将来のトラジェについて非常に貴重な洞察を提供しています

このスピーチには、人工知能が人々の運動をサポートするのに非常に優れている理由を示すエンジニアリングに関するバックグラウンド情報には、非常に洞察に満ちた視点がいくつかありました。 各寄稿者の観点からコアアイデアを概説し、スポーツにおける人工知能の適用の調査の重要な部分である3つの設計側面を実証します。 エッジデバイスと生の個人データ 人工知能に関するこのアイデアには、実際には2つのコンポーネントが含まれています。1つは大きな言語モデルを配置する場所に関連しており、もう1つは人間の言語と、リアルタイムで測定したときにバイタルサインが「表現」する言語の違いに関連しています。 アレクサンダー・アミニはランニングとテニスについて多くのことを知っていますが、彼はまだ

Caterpillarの最高情報責任者であり、その上級副社長であるJamie Engstromは、28か国の2,200人以上のITプロフェッショナルのグローバルチームを率いています。 彼女の現在の役割で4年半を含むCaterpillarで26年間、Engst

Google Photosの新しいUltra HDRツール:クイックガイド Google Photosの新しいUltra HDRツールで写真を強化し、標準画像を活気に満ちた高ダイナミックレンジの傑作に変換します。ソーシャルメディアに最適なこのツールは、あらゆる写真の影響を高め、


ホットAIツール

Undresser.AI Undress
リアルなヌード写真を作成する AI 搭載アプリ

AI Clothes Remover
写真から衣服を削除するオンライン AI ツール。

Undress AI Tool
脱衣画像を無料で

Clothoff.io
AI衣類リムーバー

Video Face Swap
完全無料の AI 顔交換ツールを使用して、あらゆるビデオの顔を簡単に交換できます。

人気の記事

ホットツール

VSCode Windows 64 ビットのダウンロード
Microsoft によって発売された無料で強力な IDE エディター

ゼンドスタジオ 13.0.1
強力な PHP 統合開発環境

SublimeText3 Linux 新バージョン
SublimeText3 Linux 最新バージョン

AtomエディタMac版ダウンロード
最も人気のあるオープンソースエディター

SublimeText3 英語版
推奨: Win バージョン、コードプロンプトをサポート!
