VLM lawan VLA

VLM vs VLA: Mengapa Model Bahasa Visi Tidak Mencukupi untuk Robotik

Dua kelas model digabungkan dalam perbualan robotik: model bahasa penglihatan dan model bahasa penglihatan-tindakan. Kedua-duanya kedengaran serupa, kedua-duanya menyerap imej dan teks, dan kedua-duanya berasal dari keturunan pralatihan multimodal yang sama. Tetapi bagi sesiapa yang cuba menggunakan sistem AI yang bergerak — bukan sekadar menggambarkan — perbezaannya adalah penting. VLM vs VLA ialah perbezaan antara model yang memahami pemandangan dan model yang menutup gelung dengan dunia fizikal.

Memahami babak tidak sama dengan lakonan

Poin-poin utama

  • VLM memetakan imej dan teks kepada output bahasa; VLA memetakannya kepada tindakan robot.
  • VLM tidak boleh memacu motor, gripper atau end-effector secara langsung.
  • VLA melanjutkan VLM dengan token tindakan yang dilatih pada data demonstrasi robot.
  • Kebanyakan seni bina VLA memperhalusi tulang belakang VLM pada episod demonstrasi.
  • Robotik gred penggunaan memerlukan data latihan gaya VLA, bukan data VLM sahaja.
  • Mengelirukan kedua-duanya membawa kepada anggaran berlebihan tentang apa yang boleh dilakukan oleh model persepsi dalam pengeluaran.

Apakah itu VLM?

VLM (model bahasa penglihatan) ialah rangkaian saraf multimodal yang mengambil imej dan teks sebagai input dan menghasilkan teks atau output berstruktur. VLM dilatih pada pasangan imej-teks pada skala besar-besaran dan cemerlang dalam pemberian kapsyen, menjawab soalan visual dan penaakulan visual.

Apakah itu vlm?

VLM: Model multimodal yang menggunakan input visi dan bahasa serta menghasilkan output bahasa atau simbolik, seperti kapsyen, klasifikasi atau rantaian penaakulan.

VLM memang berkuasa — tetapi ruang outputnya bersifat simbolik, bukan fizikal. Ia boleh menggambarkan apa yang berlaku di dapur, mengenal pasti objek atau menjawab soalan tentang sesuatu pemandangan. Ia tidak boleh mengesan apa-apa.

Apakah itu VLA?

Model VLA (visi-bahasa-tindakan) ialah model multimodal yang menggunakan input visi dan bahasa serta menghasilkan jujukan tindakan robot. Ruang output termasuk arahan motor, pose efektor akhir atau token tindakan yang dinyahkod menjadi isyarat kawalan berterusan.

Apakah itu vla?

VLA: Model asas robot yang memancarkan tindakan, bukan teks — biasanya token gerakan diskret yang memetakan pada darjah kebebasan robot.

Dalam salah satu kertas kerja asas yang mewujudkan paradigma ini, RT-2 telah memperhalusi tulang belakang bahasa penglihatan pada data demonstrasi robot dan mengeluarkan token tindakan diskret (DeepMind, 2023). Peralihan output itu — daripada teks kepada tindakan — adalah keseluruhan perbezaan seni bina.

Bagaimanakah data latihan VLM dan VLA berbeza?

Bagaimanakah data latihan vlm dan vla berbeza?

Data latihan VLM dan data latihan VLA berbeza dari segi apa yang terdapat pada penghujung setiap contoh. Contoh VLM memasangkan imej dengan kapsyen atau soal jawab. Contoh VLA memasangkan imej dengan arahan dan trajektori tindakan yang berasaskan perwujudan robot tertentu.

Satu analogi yang berguna: VLM adalah seperti penganalisis sukan yang boleh menerangkan setiap permainan secara terperinci tetapi tidak pernah memegang bola. VLA ialah pemainnya. Kepakaran penganalisis adalah nyata dan berguna — cuma ia tidak menggantikan ulangan pengendalian bola. Data latihan VLA ialah ulangan tersebut: pemerhatian serentak, arahan bahasa, label tindakan dan penanda hasil, yang diulang merentasi berjuta-juta episod.

Mengapa anda tidak boleh menggunakan VLM sahaja untuk robotik?

Vlm untuk robotikAnda tidak boleh menggunakan VLM secara langsung untuk robotik kerana ruang token output tidak sepadan dengan arahan motor. VLM mengeluarkan perkataan; robot memerlukan sudut sambungan, halaju efektor hujung atau keadaan pencengkam. Jurang antara "cawan berada di sebelah kiri" dan "gerakkan pergelangan tangan 4cm ke kiri dan tutup pencengkam" ialah jurang yang diisi oleh VLA.

Dalam praktiknya, banyak pasukan memperhalusi VLM menjadi VLA dengan memperluas perbendaharaan kata output dengan token tindakan — unit gerakan diskret yang dianggap seperti perkataan. Ini mengekalkan penaakulan VLM sambil memberinya cara untuk bertindak.

Token tindakan: Gerakan robot diskret yang dikodkan sebagai entri perbendaharaan kata yang boleh diramalkan oleh model dengan cara yang sama ia meramalkan token bahasa.

Bayangkan sebuah syarikat baharu logistik yang melesenkan VLM berkualiti tinggi dan menganggap ia boleh memacu robot pilih dan letakkan. Model tersebut memahami pemandangan dengan sempurna, menceritakan pelan yang betul dan tidak menghasilkan sebarang arahan motor. Tanpa latihan token tindakan, sistem akan tersekat pada narasi. Menambah data VLA di atas adalah apa yang membuka kunci penggunaan.

VLM vs VLA: bersebelahan

Dimensi VLM VLA
Input Imej + teks Imej + teks + (selalunya) keadaan robot
Output Bahasa / simbolik Token tindakan / arahan motor
Data latihan Pasangan imej-teks Episod dengan trajektori aksi
Gunakan kes Kapsyen, VQA, penaakulan Robotik, autonomi, AI yang diwujudkan
Perwujudan Tiada Terikat dengan robot atau keluarga tertentu
Penilaian Ketepatan, BLEU, sifat membantu Kejayaan tugas, generalisasi OOD, keselamatan

Bilakah anda perlu menggunakan setiap satu?

Gunakan VLM apabila tugasan berakhir dengan penerangan, keputusan atau respons teks. Gunakan VLA apabila tugasan berakhir dengan tindakan fizikal.

Dalam sistem hibrid, kedua-duanya mempunyai peranan. VLM mengendalikan pemahaman adegan, perbualan dan penaakulan peringkat tinggi. VLA mengendalikan kawalan gelung tertutup. Banyak seni bina pengeluaran menggunakan VLM sebagai perancang dan VLA sebagai pelaksana — kadangkala dalam reka bentuk dwi-sistem yang menukar perwakilan terpendam antara kedua-duanya. Perbezaan ini penting kerana ia memerlukan data latihan, kriteria penilaian dan kawalan kualiti yang berbeza secara asasnya. Shaip's perkhidmatan penglihatan komputer dan AI fizikal operasi data merangkumi kedua-dua hujung spektrum tersebut.

Kesimpulan

VLM vs VLA bukanlah satu pertandingan; ia adalah satu pembahagian kerja. Kedua-duanya penting untuk AI yang diwujudkan, dan kedua-duanya bergantung pada data latihan yang sepadan dengan tugas mereka. Memilih model yang betul bermakna memadankannya dengan ruang output yang betul — dan susunan set data yang betul untuk menyokongnya.

VLA bermaksud vision-language-action, kelas model yang mengambil input visi dan bahasa serta mengeluarkan tindakan robot. Komponen tindakan ialah ciri yang menentukan — ia membezakan VLA daripada model bahasa visi terdahulu yang hanya menghasilkan output teks atau simbolik.

VLM boleh diubah menjadi VLA melalui penalaan halus pada data demonstrasi robot dengan perbendaharaan kata token tindakan yang diperluas. Kebanyakan VLA moden dibina dengan cara ini, memelihara penaakulan VLM sambil mengajarnya untuk mengeluarkan arahan motor. Langkah penalaan halus memerlukan set data sejajar tindakan yang berkualiti tinggi, bukan sekadar teks tambahan.

VLA lebih daripada sekadar VLM dengan kepala yang berbeza. Walaupun banyak seni bina berkongsi tulang belakang VLM, VLA menambah penyahkod tindakan, tokenisasi yang menyedari perwujudan dan fungsi kehilangan yang dikaitkan dengan kawalan fizikal. Sesetengah reka bentuk memisahkan perancangan dan pelaksanaan ke dalam modul VLM dan VLA berasingan yang bertukar perwakilan terpendam.

Ujian VLM vs VLA yang paling mudah adalah untuk bertanya apa yang dihasilkan oleh model. Jika outputnya ialah ayat, kapsyen, pengelasan atau rantaian penaakulan, model tersebut ialah VLM. Jika outputnya ialah arahan motor, sudut sendi atau token tindakan yang memacu robot, model tersebut ialah VLA. Ruang output, bukan modaliti input, yang mentakrifkan kelas.

VLA biasanya memerlukan lebih banyak data yang dikurasi dan berstruktur berbanding VLM, walaupun jumlah kiraan token lebih kecil. Latihan VLM memanfaatkan pasangan imej-teks skala web yang bising. Latihan VLA memerlukan trajektori tindakan, penjajaran bahasa pada kebutiran episod dan label kejayaan eksplisit — yang semuanya memerlukan saluran pengumpulan dan anotasi berstruktur.

Penanda aras VLM mempunyai kegunaan terhad untuk penilaian VLA. Ketepatan kapsyen dan jawapan soalan visual mengukur persepsi dan penaakulan, bukan kawalan. Penilaian VLA bergantung pada kadar kejayaan tugas, generalisasi kepada objek dan persekitaran yang tidak kelihatan, dan prestasi pada senario berperingkat keselamatan — metrik yang tiada penanda aras VLM pada masa ini dapat ditangkap.

Menikmati artikel ini? Ikuti Shaip di LinkedIn untuk maklumat lanjut.

Kongsi sosial