Rumah >Peranti teknologi >AI >Chitrarth-1: VLM berbilang bahasa oleh Makmal Krutrim AI

Chitrarth-1: VLM berbilang bahasa oleh Makmal Krutrim AI

Joseph Gordon-Levitt
Joseph Gordon-Levittasal
2025-03-03 18:22:13942semak imbas

Landskap AI India berkembang pesat, dengan kemajuan dan inovasi yang ketara muncul. Krutrim AI Labs, sebuah syarikat kumpulan Ola, adalah pemain utama dalam pertumbuhan ini, baru-baru ini melancarkan Chitrarth-1, model bahasa penglihatan yang terobosan (VLM). Direka untuk konteks linguistik dan budaya India yang pelbagai, Chitrarth-1 menyokong sepuluh bahasa India utama ditambah bahasa Inggeris, menangani keperluan kritikal untuk penyelesaian AI berbilang bahasa. Artikel ini menyelidiki Chitrarth-1 dan implikasinya untuk keupayaan AI yang berkembang di India.

Jadual Kandungan

  • Apa itu Chitrarth-1?
  • data latihan dan metodologi
    • Fasa 1: Penyesuai Pra-Training
    • Fasa 2: Penalaan Arahan
  • Prestasi dan penanda aras
  • Mengakses Chitrarth-1
  • chitrarth-1 dalam tindakan
  • Kesimpulan

Apa itu Chitrarth-1?

Chitrarth-1 (menggabungkan "chitra"-imej dan "artha"-makna) adalah parameter 7.5 bilion VLM yang mengintegrasikan bahasa lanjutan dan pemprosesan penglihatan. Dibina untuk memenuhi keperluan linguistik India yang pelbagai, ia menyokong Hindi, Bengali, Telugu, Tamil, Marathi, Gujarati, Kannada, Malayalam, Odia, Assam, dan Inggeris. Model ini merangkumi komitmen Krutrim untuk membangunkan AI "untuk negara kita, negara kita, dan bagi warganegara kita." Penggunaan dataset yang kaya dan berbilang bahasa meminimumkan kecenderungan dan memastikan prestasi yang mantap merentasi bahasa indik dan bahasa Inggeris, mempromosikan akses AI yang saksama. Penyelidikan mengenai Chitrarth-1 diterbitkan dalam jurnal akademik terkemuka, termasuk Neurips dan Persidangan Kesembilan mengenai Terjemahan Mesin.

Chitrarth-1 menggunakan Krutrim-7b LLM sebagai asasnya, dipertingkatkan oleh pengekod penglihatan berdasarkan model SIGLIP (SIGLIP-SO400M-PATCH14-384). Komponen seni bina utama termasuk:

pengekod visi siglip pra-terlatih untuk pengekstrakan ciri imej.

    Lapisan pemetaan linear yang boleh dilatih untuk ciri -ciri imej projek ke ruang token LLM.
  • penalaan halus dengan arahan teks-teks imej yang mengikuti untuk prestasi multimodal yang lebih baik.
  • Data dan Metodologi Latihan

Latihan Chitrarth-1 melibatkan dua fasa menggunakan dataset yang luas dan berbilang bahasa:

Fasa 1: Penyesuai Pra-Training Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

  • pra-terlatih pada dataset yang pelbagai diterjemahkan ke dalam pelbagai bahasa indik menggunakan model sumber terbuka.
  • mengekalkan perwakilan bahasa Inggeris dan indik yang seimbang untuk memastikan prestasi yang saksama.
  • Direka untuk mengelakkan kecenderungan ke arah mana -mana bahasa tunggal, mengoptimumkan untuk kecekapan dan keteguhan.

Fasa 2: Penalaan Arahan

  • disesuaikan dengan dataset arahan yang kompleks untuk meningkatkan keupayaan penalaran multimodal.
  • menggunakan dataset penalaan arahan berasaskan Inggeris dan terjemahan berbilang bahasa.
  • termasuk dataset bahasa penglihatan yang memaparkan imej India yang pelbagai (personaliti, monumen, karya seni, masakan).
  • menggabungkan data teks bahasa Inggeris berkualiti tinggi untuk perwakilan domain yang seimbang.

Prestasi dan penanda aras

Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

Chitrarth-1 telah diuji dengan ketat terhadap VLMs terkemuka seperti Idefics 2 (7B) dan Palo 7B, secara konsisten mengatasi mereka pada pelbagai tanda aras sambil mengekalkan daya saing mengenai tugas-tugas seperti TextVQA dan Vizwiz. Ia juga melampaui Llama 3.2 11B Visi Mengarah dalam metrik utama. Krutrim memperkenalkan Bharatbench, sebuah suite penilaian baru untuk sepuluh bahasa indik yang kurang mendapat sumber dalam tiga tugas, mewujudkan garis dasar untuk penyelidikan masa depan dan menonjolkan keupayaan Chitrarth-1 untuk mengendalikan bahasa-bahasa ini dengan berkesan. Contoh hasil bharatbench ditunjukkan di bawah:

Untuk maklumat lanjut, klik di sini.

Mengakses Chitrarth-1

Chitrarth-1 boleh diakses melalui:

  • Pakaian muka: Penggunaan langsung atau penalaan halus. (Klik di sini untuk melawat)
  • github: (kod yang disediakan dalam artikel asal)
  • awan krutrim: (klik di sini untuk meneroka)

Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

chitrarth-1 dalam tindakan

Contoh keupayaan Chitrarth-1 termasuk analisis imej, generasi kapsyen imej, dan analisis skrin UI/UX (imej yang disediakan dalam artikel asal).

Chitrarth-1: A Multilingual VLM by Krutrim AI Labs Chitrarth-1: A Multilingual VLM by Krutrim AI Labs Chitrarth-1: A Multilingual VLM by Krutrim AI Labs

Kesimpulan

Krutrim AI Labs, pembahagian kumpulan OLA, komited untuk membina masa depan pengkomputeran AI. Dengan Chitrarth-1, dan persembahan lain seperti GPU sebagai perkhidmatan, AI Studio, dan banyak lagi, mereka mewujudkan standard baru untuk AI yang sensitif, budaya, memupuk landskap teknologi yang lebih adil.

Atas ialah kandungan terperinci Chitrarth-1: VLM berbilang bahasa oleh Makmal Krutrim AI. Untuk maklumat lanjut, sila ikut artikel berkaitan lain di laman web China PHP!

Kenyataan:
Kandungan artikel ini disumbangkan secara sukarela oleh netizen, dan hak cipta adalah milik pengarang asal. Laman web ini tidak memikul tanggungjawab undang-undang yang sepadan. Jika anda menemui sebarang kandungan yang disyaki plagiarisme atau pelanggaran, sila hubungi admin@php.cn