북경대학교와 EVLO 혁신팀은 자율주행을 위한 4차원 시공간 사전 훈련 알고리즘인 DriveWorld를 공동으로 제안했습니다. 이 방법은 사전 훈련을 위해 세계 모델을 사용하고, 4차원 시공간 모델링을 위한 메모리 상태 공간 모델을 설계하고, 장면의 점유 그리드를 예측하여 자율주행이 직면하는 무작위 불확실성과 지식 불확실성을 줄입니다. 이 논문은 CVPR 2024에 승인되었습니다.
논문 제목: DriveWorld: 4D Pre-trained Scene Understanding via World Models for Autonomous Driving
논문 링크: https://www.php.cn/link/293643def1ba1161bcdcfbfe434ab76d
1. 동기 부여
자율주행의 장면 이해 작업에는 장면 인식, 미래 변화 예측 등 여러 수준이 포함됩니다. 이러한 수준에는 공간의 3차원 구조뿐만 아니라 시간 차원의 동적 변화도 포함됩니다. 이러한 복잡한 장면 이해를 위해서는 모델이 정확한 결정을 내리기 위해 4차원 공간과 시간의 본질적인 상관관계를 포착하고 이해할 수 있어야 합니다. 4차원 시공간 표현을 학습하는 것은 자연 장면의 확률론적 특성, 환경의 로컬 관찰 가능성 및 다양한 다운스트림 작업의 다양성으로 인해 매우 어렵습니다. 사전 훈련은 대량의 데이터로부터 보편적인 표현을 얻어 보편적인 지식을 갖춘 기본 모델을 구축하는 데 핵심적인 역할을 합니다. 그러나 자율주행에 있어서 4차원 시공간에 대한 사전 훈련 연구는 아직 상대적으로 적은 편이다.
자율 주행 시스템의 설계와 구현은 다양한 불확실성에 직면하고 처리해야 하며, 이는 주로 우연적 불확실성과 인식적 불확실성의 두 가지 범주로 나뉩니다. 우연적 불확실성은 보행자의 갑작스러운 움직임이나 차량의 예상치 못한 행동과 같은 세상에 내재된 무작위성에서 발생합니다. 인식적 불확실성은 폐쇄 또는 센서 제한으로 인한 정보 부족과 같은 환경에 대한 불완전한 지식으로 인해 발생합니다. 이러한 불확실성을 효과적으로 처리하기 위해 자율주행 시스템은 과거 경험을 활용하여 가능한 미래 상태를 예측하고 보이지 않는 영역에 대해 추론할 수 있어야 합니다. 이 작업은 인식, 예측 및 계획 작업에서 자율 주행 시스템의 성능을 향상시키는 것을 목표로 4차원 시공간 사전 훈련된 세계 모델을 통해 이러한 과제를 해결합니다.
2. 방법
자율주행 서라운드 카메라 시스템이 관찰한 T개의 비디오 프레임 o1:T와 그에 상응하는 전문가 행동 a1:T 및 3차원 점유 그리드 라벨 y1:T에 대해, 여기서 3D LiDAR 포인트 클라우드 및 자세 데이터를 사용하여 3차원 점유 래스터 라벨을 얻을 수 있습니다. 우리는 과거의 다중 시점 이미지와 행동으로부터 현재와 미래의 3D 점유 그리드를 예측하는 세계 모델로부터 소형 BEV 표현을 학습하는 것을 목표로 합니다.
2.1 시계열 확률 모델
모델에 4차원 공간과 시간을 모델링할 수 있는 기능을 부여하기 위해 먼저 두 가지 잠재적 변수(h1:T, s1:T)를 도입합니다. 여기서 ht는 시간 단계 t의 모든 과거 정보를 포함한 과거 정보 변수, st는 미래 상태를 예측하는 모델의 핵심인 무작위 상태 변수를 나타냅니다. ht는 과거 정보 h1:t−1과 무작위 상태 s1:t−1을 통해 업데이트됩니다. 미래 상태를 예측하기 위해 RSSM(Recurrent State-Space Model)을 따르고 사후 상태 분포 q(st∣o≤t,a BEV 특징의 차원성이 높다는 점을 고려하여 이를 1차원 벡터 xt로 변환한 다음 (ht,at−1,xt)에서 가우스 분포를 샘플링하여 사후 상태 분포를 생성합니다. 관찰된 이미지가 없는 경우 모델은 과거 정보와 예측된 작업을 기반으로 사전 상태 분포를 도출합니다. 2.1.1 동적 메시징 Dalam pemahaman adegan pemanduan autonomi, mempertimbangkan pergerakan objek adalah penting untuk meramalkan keadaan masa hadapan dengan tepat. Untuk menangkap maklumat dinamik ini, kami mencadangkan untuk memodelkan gerakan objek dengan memperkenalkan parameter gerakan untuk mencapai persepsi gerakan semasa penyebaran maklumat dinamik. Kami memperkenalkan normalisasi lapisan sedar gerakan (MLN). Atribut gerakan termasuk halaju v dan selang masa relatif Δt. (v,Δt) diratakan dan diubah menjadi vektor afin γ dan β melalui dua lapisan linear (ξ1,ξ2): γ=ξ1(v,Δt),β=ξ2(v,Δt). Transformasi afin kemudiannya dilakukan untuk mendapatkan keadaan stokastik yang mendasari persepsi gerakan, dinyatakan sebagai st=γ⋅LN(st)+β. Semasa kenderaan bergerak, keadaan sejarah yang menentukan ht boleh membina perpustakaan memori dinamik h1:t. Dengan melakukan pengiraan mekanisme silang perhatian dengan bank memori dinamik, keadaan sejarah yang menentukan ht boleh diperolehi. 2.1.2 Pemindahan maklumat spatial Dalam pemahaman adegan pemanduan autonomi, selain maklumat perubahan dinamik, maklumat struktur ruang adalah sama penting. Memandangkan bingkai adegan berterusan biasanya mengandungi hanya perubahan kecil, dan kandungan utama adegan itu selalunya terdiri daripada objek statik, seperti jalan raya, pokok dan tanda lalu lintas, apabila memproses maklumat ini, adalah mungkin untuk menukar imej input secara terus kepada vektor satu dimensi Ini akan menyebabkan kehilangan maklumat struktur spatial utama. Kami secara rawak memilih bingkai o 'daripada bingkai 1 hingga T dan menggunakan ciri BEVnya b' untuk membina perwakilan statik terpendam b^=zθ(b') yang menerangkan struktur persepsi spatial. Kami menggabungkan perwakilan statik b^ yang sedar dari segi ruang dengan st perwakilan gerakan yang berubah secara dinamik untuk mendapatkan gambaran menyeluruh bagi pemandangan sekeliling. 2.2 Pra-latihan tugas tambahan Pemahaman menyeluruh tentang persekitaran sekeliling adalah penting untuk pemanduan autonomi. Kami mencadangkan untuk memodelkan dunia fizikal sebagai struktur grid penghunian tiga dimensi untuk menerangkan persekitaran di sekeliling kenderaan. Penyahkod grid penghunian tiga dimensi ditetapkan kepada y^t=lθ(mθ(h~t,st),b^), dengan mθ ialah rangkaian yang memanjangkan ciri satu dimensi ke dimensi BEV, dan lθ digunakan untuk ramalkan rangkaian konvolusi 3D grid penghunian. Pra-latihan grid penghunian empat dimensi ini bukan sahaja dapat menangkap struktur statik tempat kejadian, tetapi juga memahami perubahan dinamik tempat kejadian dari semasa ke semasa, memberikan pemahaman alam sekitar yang lebih kaya dan lebih dinamik untuk sistem pemanduan autonomi. 2.3 Mekanisme gesaan tugas Walaupun perwakilan spatiotemporal empat dimensi boleh dipelajari melalui tugas pra-latihan yang direka oleh model dunia, tugas hiliran yang berbeza memfokuskan pada maklumat yang berbeza. Untuk mengurangkan masalah ini, diilhamkan oleh isyarat semantik untuk pengecaman imej beberapa tangkapan dan isyarat berpandukan contoh visual dalam pembelajaran berbilang tugas, mekanisme "petunjuk tugas" diperkenalkan untuk menyediakan isyarat khusus untuk tugasan yang berbeza untuk membimbing mereka mengekstrak berkaitan tugasan. ciri. Memandangkan terdapat korelasi semantik antara tugasan yang berbeza, kami menggunakan model bahasa besar gφ(⋅) (cth., BERT, CLIP) untuk membina pembayang tugas ini. Sebagai contoh, gesaan tugas untuk tugas pembinaan semula grid penghunian tiga dimensi lebih menumpukan pada adegan semasa dan ditetapkan kepada "tugasnya adalah untuk meramalkan grid penghunian tiga dimensi adegan semasa." Kami memasukkan ptext gesaan ke dalam gφ(⋅) untuk mendapatkan pengekodan segera gφ(ptext). Ia kemudiannya dilanjutkan kepada dimensi BEV, dilambangkan sebagai qφ(gφ(pteks)), dan disepadukan dengan ciri spatiotemporal yang dipelajari. 2.4 Fungsi objektif pra-latihan Objektif pra-latihan DriveWorld termasuk meminimumkan perbezaan antara taburan keadaan posterior dan taburan keadaan sebelumnya (iaitu perbezaan Kullback-Leibler (KL)), dan meminimumkan perbezaan antara masa lalu dan Kerugian yang berkaitan dengan grid penghunian tiga dimensi masa hadapan (iaitu, kehilangan entropi silang (CE)) dan tindakan (iaitu, kehilangan L1). Kami mengguna pakai model untuk memerhati input untuk langkah masa T dan kemudian meramalkan grid pekerjaan tiga dimensi masa depan dan langkah L tindakan. 3. Eksperimen 3.1 Tetapan percubaan Kami telah melatih awal tentang nuScenes dan OpenScenes pada set data pemanduan autonomi, dan diperhalusi pada nuScenes. Kami menggunakan pengagregatan awan titik LiDAR berbilang bingkai untuk mendapatkan label grid penghunian 3D yang padat. 3.2 Keputusan eksperimen Sebahagian daripada keputusan ditunjukkan di sini Untuk mendapatkan keputusan lanjut, sila rujuk kertas. 4. Ringkasan DriveWorld mempertingkatkan pemahaman sistem pemanduan autonomi dan keupayaan ramalan persekitaran sekeliling melalui pra-latihan ruang masa empat dimensi berdasarkan model dunia, dan mengurangkan ketidakpastian yang dihadapi oleh pemanduan autonomi. DriveWorld mencadangkan model ruang keadaan memori untuk pemodelan spatiotemporal, yang termasuk modul storan memori dinamik untuk pembelajaran perwakilan sedar masa dan modul penyebaran adegan statik untuk pembelajaran perwakilan sedar ruang. Untuk meningkatkan lagi kebolehsuaian dan fleksibiliti model, DriveWorld turut memperkenalkan mekanisme gesaan tugas, yang membolehkan model menyesuaikan perwakilannya secara adaptif mengikut keperluan tugas semasa, dengan itu mencapai prestasi terbaik dalam tugas pemanduan autonomi yang berbeza. Rujukan [1]Chen Min, et al. Pra-Latihan Bersepadu Berbilang Kamera Melalui Pembinaan Semula Adegan 3D[J]. Occupancy-mae: Awan titik lidar berskala besar pralatihan sendiri dengan pengekod auto penghunian bertopeng[J]. Transaksi IEEE pada Kenderaan Pintar, 2023. hao China Pengarah Perisikan dan saintis muda Multimedia Cognitive Learning Laboratory (EVOL Lab) Institut Penyelidikan Pintar, penyelidik dan penyelia kedoktoran di Institut Optoelektronik dan Kecerdasan Universiti Politeknik Barat Laut Beliau berkelulusan PhD kepentingan penyelidikan termasuk analisis multimedia, keselamatan tempatan, dan penjelmaan. https://www.php.cn/link/2e36742b377be90ffbf55399215iin Lei Min Cheng
p(st ∣ht− 1,st−1)∽N(μθ(ht,a^t−1),σθ(ht,a^t−1)I),
여기서 st는 대각 공분산을 갖는 정규 분포로 매개변수화됩니다. 초기 분포는 s1∽N(0,I)로 설정됩니다. ( μ , σ )는 매개변수화된 사후 상태 분포를 갖는 다층 퍼셉트론입니다.
p(st∣ht−1,st−1)∽N(μθ(ht,a^t− 1) ,σθ(ht,a^t−1)I),
여기서 (μθ,σθ)는 이전 상태 분포를 매개변수화합니다. ??는 과거 정보 ht−1과 무작위 상태 st−1을 기반으로 행동 a^t−1을 예측하는 데 사용되는 정책 네트워크입니다.
Keadaan sejarah penentu ialah ht+1=fθ(ht,st).
위 내용은 CVPR 2024 | 자율주행 세계 모델의 4차원 시공간 사전 훈련의 상세 내용입니다. 자세한 내용은 PHP 중국어 웹사이트의 기타 관련 기사를 참조하세요!

과학자들은 C. el 그러나 중요한 질문이 발생합니다. 새로운 AI S와 함께 효과적으로 작동하도록 우리 자신의 신경망을 어떻게 조정합니까?

Google의 Gemini Advanced : 수평선의 새로운 가입 계층 현재 Gemini Advanced에 액세스하려면 $ 19.99/월 Google One AI Premium Plan이 필요합니다. 그러나 Android Authority 보고서는 다가오는 변경 사항을 암시합니다. 최신 Google p. 내 코드

고급 AI 기능을 둘러싼 과대 광고에도 불구하고 Enterprise AI 배포 내에서 상당한 도전 과제 : 데이터 처리 병목 현상. CEO는 AI 발전을 축하하는 동안 엔지니어는 느린 쿼리 시간, 과부하 파이프 라인,

문서 처리는 더 이상 AI 프로젝트에서 파일을 여는 것이 아니라 혼돈을 명확하게 전환하는 것입니다. PDF, PowerPoint 및 Word와 같은 문서는 모든 모양과 크기로 워크 플로우를 범람합니다. 구조화 된 검색

Google의 에이전트 개발 키트 (ADK)의 전력을 활용하여 실제 기능을 갖춘 지능형 에이전트를 만듭니다! 이 튜토리얼은 Gemini 및 GPT와 같은 다양한 언어 모델을 지원하는 ADK를 사용하여 대화 에이전트를 구축하는 것을 안내합니다. w

요약: SLM (Small Language Model)은 효율성을 위해 설계되었습니다. 자원 결핍, 실시간 및 개인 정보 보호 환경에서 LLM (Large Language Model)보다 낫습니다. 초점 기반 작업, 특히 도메인 특이성, 제어 성 및 해석 성이 일반적인 지식이나 창의성보다 더 중요합니다. SLM은 LLM을 대체하지는 않지만 정밀, 속도 및 비용 효율성이 중요 할 때 이상적입니다. 기술은 더 적은 자원으로 더 많은 것을 달성하는 데 도움이됩니다. 그것은 항상 운전자가 아니라 프로모터였습니다. 증기 엔진 시대부터 인터넷 버블 시대에 이르기까지 기술의 힘은 문제를 해결하는 데 도움이되는 정도입니다. 인공 지능 (AI) 및보다 최근에 생성 AI가 예외는 아닙니다.

컴퓨터 비전을위한 Google Gemini의 힘을 활용 : 포괄적 인 가이드 주요 AI 챗봇 인 Google Gemini는 강력한 컴퓨터 비전 기능을 포괄하기 위해 대화를 넘어서 기능을 확장합니다. 이 안내서는 사용 방법에 대해 자세히 설명합니다

2025 년의 AI 환경은 Google의 Gemini 2.0 Flash와 Openai의 O4-Mini가 도착하면서 전기가 전환됩니다. 이 최첨단 모델은 몇 주 간격으로 발사되어 비슷한 고급 기능과 인상적인 벤치 마크 점수를 자랑합니다. 이 심층적 인 비교


핫 AI 도구

Undresser.AI Undress
사실적인 누드 사진을 만들기 위한 AI 기반 앱

AI Clothes Remover
사진에서 옷을 제거하는 온라인 AI 도구입니다.

Undress AI Tool
무료로 이미지를 벗다

Clothoff.io
AI 옷 제거제

Video Face Swap
완전히 무료인 AI 얼굴 교환 도구를 사용하여 모든 비디오의 얼굴을 쉽게 바꾸세요!

인기 기사

뜨거운 도구

메모장++7.3.1
사용하기 쉬운 무료 코드 편집기

안전한 시험 브라우저
안전한 시험 브라우저는 온라인 시험을 안전하게 치르기 위한 보안 브라우저 환경입니다. 이 소프트웨어는 모든 컴퓨터를 안전한 워크스테이션으로 바꿔줍니다. 이는 모든 유틸리티에 대한 액세스를 제어하고 학생들이 승인되지 않은 리소스를 사용하는 것을 방지합니다.

VSCode Windows 64비트 다운로드
Microsoft에서 출시한 강력한 무료 IDE 편집기

WebStorm Mac 버전
유용한 JavaScript 개발 도구

PhpStorm 맥 버전
최신(2018.2.1) 전문 PHP 통합 개발 도구
