Model VLA

Model VLA: Apa yang Diperlukan oleh Model Visi-Bahasa-Tindakan daripada Data Latihan

Peralihan daripada chatbot kepada robot yang mengikuti arahan bahasa semula jadi berjalan melalui satu kelas model. Model VLA — model visi-bahasa-tindakan — menggabungkan persepsi visual, pemahaman bahasa dan penjanaan tindakan dalam satu rangkaian saraf. Kuasa mereka adalah nyata, tetapi ia bergantung hampir sepenuhnya pada data latihan yang mereka ambil. Panduan ini menerangkan apa yang sebenarnya terkandung dalam data latihan VLA, apa yang dipandang remeh oleh pasukan dan cara merancang set data yang menghasilkan model yang berbaloi untuk digunakan.

Poin-poin utama

  • Model VLA memetakan input visi dan bahasa terus kepada tindakan robot dalam satu rangkaian.
  • Data latihan mesti merangkumi pemerhatian visual yang disegerakkan, arahan bahasa dan tindakan.
  • Token tindakan diskret memerlukan data demonstrasi berskala besar untuk dipelajari dengan baik.
  • Video manusia yang egosentrik semakin banyak dilombong sebagai sumber pralatihan VLA berkos rendah.
  • Episod penilaian yang mantap adalah sama pentingnya dengan data latihan untuk pelaksanaan yang andal.
  • Penalaan halus VLA berjaya atau gagal berdasarkan ketelitian anotasi, bukan kelantangan mentah sahaja.

Apakah model VLA?

Model VLA ialah model asas robot yang mengambil imej dan arahan bahasa semula jadi sebagai input dan mengeluarkan tindakan robot. Tidak seperti saluran paip tradisional yang memisahkan persepsi, perancangan dan kawalan kepada modul yang berbeza, model visi-bahasa-tindakan mempelajari pemetaan hujung ke hujung dalam rangkaian tunggal.

Model tindakan bahasa penglihatan data latihan

Model VLA: Rangkaian saraf yang mengambil pemerhatian visual yang disegerakkan dan arahan bahasa semula jadi dan menghasilkan urutan tindakan robot atau token tindakan.

Reka bentuk bersepadu ini membolehkan model VLA mewarisi keupayaan penaakulan daripada pralatihan bahasa penglihatan yang besar dan melanjutkannya dengan kawalan motor. Untuk penggunaan, ini bermakna satu model pada prinsipnya boleh melaksanakan banyak tugas — tetapi hanya jika data latihannya merangkuminya dengan struktur yang betul.

Apakah yang sebenarnya terkandung dalam data latihan VLA?

Data latihan VLA mengandungi empat bahan teras setiap episod: pemerhatian visual, arahan bahasa semula jadi, trajektori tindakan dan label kejayaan atau kegagalan. Di sekelilingnya, pasukan menambah cap masa, keadaan proprioseptif dan penanda penilaian.

Empat lapisan wajib

Empat lapisan wajib:

  1. Pemerhatian visual — Bingkai RGB, selalunya digandingkan dengan pandangan kedalaman atau kamera pergelangan tangan.
  2. Arahan bahasa — arahan bahasa semula jadi yang ringkas seperti “tuang air ke dalam cawan.”
  3. Trajektori tindakan — urutan tindakan diskret atau berterusan dipetakan kepada darjah kebebasan robot.
  4. Label hasil — penanda kejayaan, kegagalan atau penyiapan separa yang jelas setiap episod.

Model VLA terbuka dengan parameter 7 bilion telah dilatih pada lebih daripada satu juta episod yang diambil daripada 22 perwujudan robot (Stanford et al., 2024), yang menggambarkan kepelbagaian yang dijangkakan untuk generalisasi silang tugas. Tanpa keluasan ini, model VLA cenderung untuk menghafal objek tertentu dan bukannya menggeneralisasi.

Mengapakah anotasi tindakan lebih sukar daripada anotasi imej?

Anotasi tindakan adalah lebih sukar kerana tindakan berada dalam ruang berterusan dan berdimensi tinggi dan bergantung pada perwujudan robot, bukan hanya kandungan bingkai. Melabelkan kotak sempadan pada cawan adalah mudah; melabelkan trajektori yang berjaya memegang cawan tersebut dengan pencengkam tertentu pada titik sentuhan tertentu tidak.

Token tindakan: Perwakilan diskret bagi gerakan robot atau anjakan efektor akhir yang boleh diramalkan oleh model VLA seperti token bahasa.

Pasukan anotasi perlu menyelaraskan setiap token tindakan dengan pemerhatian segeraknya, menandakan saat hubungan, menangkap pemulihan kegagalan dan menanda sempadan atom arahan bahasa. Shaip's anotasi data Aliran kerja mengendalikan perkara ini secara berskala, dengan taksonomi berstruktur yang ditala kepada ruang tindakan robot dan ambang penerimaan setiap tugas.

Di manakah video manusia yang egosentrik sesuai dengan latihan VLA?

Di manakah video manusia yang egosentrik sesuai dengan latihan vla? Video manusia yang egosentrik sesuai sebagai sumber pralatihan berskala yang mengisi jurang yang tidak dapat dicapai oleh data robot sebenar. Rakaman orang pertama manusia memasak, memetik dan memasang merakam tingkah laku pada skala yang tidak akan dapat dicapai oleh teleoperasi robot.

Satu kertas kerja baru-baru ini telah mengubah video manusia egosentrik yang tidak berstruktur kepada episod berformat VLA — 1 juta segmen dan 26 juta bingkai — dengan menganggap tangan manusia sebagai efektor akhir yang mahir (Wu et al., arXiv, 2025). Data penjelmaan silang jenis ini kini menjadi rutin dalam resipi pralatihan VLA.

Masalahnya: video mentah bukanlah data latihan. Ia memerlukan segmentasi, penerangan bahasa, penyasaran semula postur tangan dan pengesahan kualiti sebelum ia mencapai saluran VLA. Shaip's AI fizikal Operasi data termasuk penangkapan egosentrik, penukaran real2sim dan anotasi sejajar VLA dalam satu penghantaran.

Bagaimanakah anda membina set penilaian yang mengesan mod kegagalan VLA?

Set penilaian menangkap mod kegagalan VLA apabila ia direka bentuk sebelum latihan, bukan selepas. Tiga struktur paling penting: penanda aras kejayaan dalam pengedaran, prob generalisasi luar pengedaran dan senario keselamatan berperingkat risiko.

Bayangkan model VLA isi rumah yang dilatih secara meluas tentang tugasan dapur. Set penilaian yang munasabah akan menguji: tugasan yang diketahui di dapur yang diketahui (dalam pengagihan), tugasan yang diketahui dalam pencahayaan yang tidak dikenali (OOD ringan), objek yang tidak diketahui dengan arahan yang diketahui (pengitlakan konsep) dan peristiwa yang jarang berlaku seperti tumpahan tidak sengaja (peringkat keselamatan). Tanpa setiap satu, risiko penggunaan kekal tidak diukur.

Sumber neutral yang berguna untuk mengatur perlindungan peringkat risiko ialah Rangka Kerja Pengurusan Risiko NIST AI, yang memisahkan peringkat impak dengan cara yang memetakan secara bersih ke dalam reka bentuk set penilaian.

Data latihan VLA: apa yang perlu dianggarkan

Layer Apa yang termasuk Perangkap biasa
Pemerhatian visual RGB berbilang paparan, kedalaman, kamera pergelangan tangan Cap masa tiada atau tidak disegerakkan
Bahasa Arahan, penerangan atom Ungkapan yang samar-samar yang tidak sepadan dengan tindakan
Trajektori tindakan Token diskret atau kawalan berterusan Tiada penjajaran dengan perwujudan robot
Penilaian Episod, prob OOD, peringkat keselamatan Direka bentuk terlalu lewat, selepas model dibekukan

Kesimpulan: Model VLA menang atau kalah dalam set data

Had maksimum model VLA ditetapkan oleh data latihannya — keluasannya, kedalaman anotasinya dan ketelitian penilaiannya. Pasukan yang merancang set data seperti produk, bukan sekadar pemikiran kemudian, akan memulakan penggunaan terlebih dahulu. Pasukan yang mengikis video dan berharap untuk keupayaan baharu biasanya tidak berbuat demikian.

Perbezaannya terletak pada skop. Dasar robotik secara tradisinya memetakan pemerhatian kepada tindakan untuk satu tugas atau keluarga tugas kecil. Model VLA ialah dasar asas yang bertujuan untuk mengendalikan banyak tugas merentasi banyak objek, yang dikondisikan pada arahan bahasa semula jadi. Kedua-duanya adalah dasar; model VLA hanyalah versi umum yang dilatih pada data yang lebih luas dan sejajar dengan bahasa.

Satu larian penalaan halus biasanya menggunakan beberapa ribu hingga beberapa ratus ribu demonstrasi berkualiti tinggi, bergantung pada kerumitan tugas dan kekuatan model asas. Tulang belakang VLA yang telah dilatih terlebih dahulu mengurangkan keperluan kelantangan dengan ketara. Faktor penentu ialah kualiti anotasi dan ketepatan arahan bahasa, bukan kiraan episod mentah sahaja.

Melatih model VLA sepenuhnya pada data simulasi adalah mungkin tetapi jarang mencukupi untuk penggunaan. Simulasi mengendalikan kepelbagaian dan peristiwa yang jarang berlaku dengan baik; penangkapan dunia sebenar mendasarkan dinamik sentuhan dan pemindahan simulasi-ke-nyata. Kebanyakan saluran pengeluaran menggabungkan kedua-duanya, dengan penanda aras berpasangan yang secara eksplisit mengukur jurang prestasi simulasi-ke-realiti.

Data latihan VLA memerlukan video RGB yang disegerakkan dan trajektori tindakan secara minimum. Saluran paip berprestasi tinggi menambah kedalaman, pandangan kamera pergelangan tangan, audio, IMU dan bacaan daya atau tork bergantung pada kelas tugas. Perincian yang tidak boleh dirundingkan ialah penyegerakan masa merentasi modaliti — tanpanya, isyarat bahasa dan tindakan akan terpisah dalam latihan.

Menilai set data VLA berfungsi merentasi empat pemeriksaan: ketepatan penjajaran bahasa-tindakan, ketekalan segmentasi episod, keluasan liputan ruang tindakan dan perwakilan kes pinggir. Semakan manusia berasaskan sampel dengan penentukuran set emas adalah titik permulaan yang paling andal. Persetujuan antara anotator melebihi 95% pada label tindakan adalah ambang pengeluaran yang biasa.

Data latihan VLA ialah superset data pembelajaran tiruan. Data pembelajaran tiruan memberi tumpuan kepada pasangan pemerhatian-tindakan daripada demonstrasi. Data VLA menambah arahan bahasa, struktur berbilang tugas dan liputan penjelmaan silang berskala besar supaya model boleh digeneralisasikan melangkaui trajektori yang dihafal.

Menikmati artikel ini? Ikuti Shaip di LinkedIn untuk maklumat lanjut.

Kongsi sosial