Data Latihan AI Fizikal

Data Latihan AI Fizikal: Lapisan Hilang Antara Visi dan Tindakan

Satu corak yang biasa telah muncul dalam robotik dan sistem autonomi: demo utama berjalan dengan baik di atas pentas, sistem yang sama terperangkap dalam gudang langsung dua minggu kemudian, dan bedah siasat menyalahkan "realiti" kerana lebih bersepah daripada persekitaran ujian. Sesetengah suara di lapangan berpendapat lapisan yang hilang adalah perkakasan — cengkaman yang lebih baik, sensor tork daya, kulit sentuhan. Hujah itu betul, tetapi tidak lengkap. Malah perkakasan penderiaan yang ideal menghasilkan aliran isyarat mentah yang perlu diatasi oleh model. belajar untuk mentafsir. Kesesakan sebenar di sebalik kebanyakan kegagalan AI Fizikal bukanlah sensor. Ia adalah multimodal Data latihan AI fizikal yang mengajar model maksud isyarat tersebut, bagaimana ia berkaitan dengan penglihatan, dan tindakan yang perlu diambil apabila dunia menolak. Data itu hampir tidak wujud pada skala perindustrian — dan itulah lapisan yang hilang.

Apakah "Lapisan Hilang" dalam AI Fizikal Sebenarnya

Gelung AI Fizikal yang biasa — mengesan, membuat keputusan, bertindak, menyesuaikan diri — dibincangkan seolah-olah ia merupakan masalah perkakasan dan seni bina. Dalam praktiknya, setiap anak panah dalam gelung itu merupakan tingkah laku yang dipelajari. Sense bermaksud model yang menukar strim sensor berdimensi tinggi yang bising kepada anggaran keadaan yang boleh diambil tindakan. Putuskan bermaksud dasar yang telah menyaksikan variasi yang mencukupi untuk digeneralisasikan. Akta bermaksud kawalan yang dipelajari terhadap dinamik sebenar. Menyesuaikan bermaksud mengenali, dalam milisaat, bahawa cengkaman tergelincir atau bahagiannya tidak sejajar — dan membetulkan pergerakan pertengahan. Tiada satu pun daripada tingkah laku tersebut boleh diprogramkan untuk diwujudkan. Ia dipelajari daripada contoh. Apabila sistem AI Fizikal tidak dapat menyesuaikan diri semasa sentuhan, punca utama yang biasa berlaku ialah data latihannya tidak pernah menyertakan contoh sentuhan berlabel yang mencukupi untuk dipelajari. Perkakasan boleh menstrim isyarat yang betul. Model masih memerlukan set data yang menjadikan isyarat tersebut bermakna sesuatu.

Mengapa Set Data Visi Sahaja Memecahkan AI Fizikal

Set data penglihatan sahaja memecahkan ai fizikalBayangkan pengendali pemenuhan bersaiz sederhana melancarkan pemilih kolaboratif merentasi tiga pusat pengedaran. Model visi pemilih dilatih pada berjuta-juta imej produk. Ia mengenal pasti item serta-merta. Minggu pertama penggunaan langsung, prestasi kelihatan baik. Minggu ketiga, daya pemprosesan menurun sebanyak satu pertiga. Item yang dihadapi oleh pemilih tidak sukar untuk lihatMereka sukar untuk mengendalikan: karton separuh hancur yang berubah bentuk apabila disentuh, berkas pengecut yang tergelincir, dan kulit kerang plastik reflektif yang mengelirukan anggaran kedalaman apabila digabungkan dengan lampu atas. Data penglihatan memberitahu model rupa barang-barang tersebut. Tiada apa-apa dalam set latihan yang memberitahunya bagaimana rasanya, bagaimana ia bertindak balas terhadap daya, atau bila cengkaman hampir gagal.

Ini adalah jurang struktur dalam kebanyakan susunan AI Fizikal — dan ia muncul dalam set data sebelum ia muncul di lantai kilang.

Dimensi Set data penglihatan sahaja Set data latihan AI Fizikal Multimodal
Modaliti Imej RGB, kedalaman sekali-sekala Penglihatan, kedalaman, sentuhan, daya/tork, propriosepsi, audio
Sumber tangkapan Imej yang dikikis atau dipentaskan Dikumpulkan secara tujuan daripada interaksi sebenar atau teleoperasi
Jenis anotasi Kotak sempadan, segmentasi, kelas Peristiwa sentuhan, gelinciran, kualiti cengkaman, profil daya, penjajaran temporal
Ekonomi skala Murah untuk digandakan Mahal — setiap sampel memerlukan interaksi fizikal
Padanan tugasan hiliran Persepsi, navigasi Manipulasi, penyesuaian, kawalan kaya sentuhan

Penanda aras manipulasi yang disemak oleh rakan sebaya telah menunjukkan bahawa penambahan data sentuhan pada saluran latihan penglihatan sahaja boleh meningkatkan kadar kejayaan manipulasi sebanyak kira-kira 20 mata peratusan, dengan peningkatan bermakna yang lain daripada pralatihan visual-sentuhan bersama (Sumber: Keputusan penanda aras IROS IEEE/RSJ, 2024). Perbezaannya bukanlah sedikit. Ia adalah garisan antara demo dan penggunaan.

Empat Lapisan Set Data Latihan AI Fizikal Sebenar

Membina set data yang benar-benar mengajar model untuk bertindak dalam dunia fizikal memerlukan empat lapisan yang berkait rapat. Langkau mana-mana satu daripadanya dan tindanan di atasnya akan runtuh.

Empat lapisan set data latihan AI fizikal sebenar

  1. Penangkapan berbilang modal. Set data mesti mengandungi apa yang sebenarnya akan dialami oleh robot: video RGB dan kedalaman yang disegerakkan, LiDAR atau stereo jika berkaitan, isyarat sentuhan (taburan tekanan, getaran, gelinciran), bacaan daya dan tork pada titik sentuhan, data proprioseptif tentang keadaan cengkaman dan selalunya audio. Rig penangkapan sama pentingnya dengan sensor — penempatan, penentukuran dan keupayaan untuk mencapai kes pinggir yang paling penting. Pasukan yang membina dalaman ini biasanya memasangkan armada dalaman dengan pakar. Pengumpulan data AI fizikal rakan kongsi untuk mencapai kepelbagaian, geografi dan keluasan senario yang diperlukan oleh set data yang mantap.
  2. Penyegerakan masa dan gabungan sensor. Lonjakan taktil pada 1,500 Hz tidak bermakna tanpa mengetahui apa yang ditunjukkan oleh aliran penglihatan dan sensor daya dalam milisaat yang sama. Penjajaran temporal merentasi modaliti membolehkan model mempelajari, contohnya, bahawa isyarat visual tertentu meramalkan peristiwa gelinciran 40 milisaat sebelum tekanan taktil menurun. Tanpa penyegerakan, anda mempunyai aliran selari dan bukannya data latihan.
  3. Anotasi kaya dengan sentuhan. Ini merupakan lapisan yang paling sukar dan yang paling dipandang rendah oleh kebanyakan program. Anotator perlu melabelkan kualiti cengkaman, momen gelinciran, permulaan dan pelepasan sentuhan, kedudukan objek di dalam pemegang cengkaman, ubah bentuk di bawah daya dan sempadan temporal sub-tindakan. Mencapai matlamat ini dengan betul memerlukan pasukan anotasi terlatih, semakan berbilang peringkat dan garis panduan yang konsisten merentasi modaliti — itulah sebabnya kebanyakan operasi serius bergantung pada aliran kerja anotasi data berstruktur daripada cuba menskalakannya secara ad hoc.
  4. Maklum balas operasi yang berterusan. Sebaik sahaja sistem AI Fizikal digunakan, setiap pilihan yang berjaya, hampir gagal dan kegagalan menjadi data baharu. Pasukan yang menutup gelung — menangkap, melabel, melatih semula, menggunakan semula — melihat keuntungan yang semakin meningkat. Pasukan yang tidak melihat model mereka hanyut secara senyap apabila dunia di sekeliling mereka berubah.

Mengapa Anotasi AI Fizikal Merupakan Disiplin yang Berbeza

Anotasi ai fizikal adalah disiplin yang berbezaMenganotasi data latihan AI Fizikal bukanlah pelabelan imej dengan langkah tambahan. Ia adalah disiplin yang berbeza. Anggapkannya seperti melatih seorang chef perantis berbanding menunjukkan kepada mereka video memasak. Video mengajar pengecaman — itu potongan julienne, ini brunoisePerantisan mengajar bagaimana rasanya pisau tajam melawan bawang yang keras, apabila kuali cukup panas tanpa memeriksa termometer, dan cara melaraskan cengkaman apabila pemegangnya menjadi licin. Jenis pembelajaran kedua memerlukan seseorang di sisi perantis, melabelkan pengalaman hidup dari semasa ke semasa. Anotasi AI fizikal berfungsi dengan cara yang sama: anotator bukan sahaja menandakan apa yang kelihatan; ia melabelkan peristiwa sentuhan, profil daya, permulaan gelinciran dan sempadan temporal tindakan merentasi strim sensor yang disegerakkan. Ia memerlukan anotator yang menyedari domain, QC yang kukuh dan peralatan khusus. Dilakukan dengan baik, ia mengubah penangkapan multimodal mentah menjadi jenis data latihan robotik yang sebenarnya mengajar model untuk mengendalikan sentuhan. Jika dilakukan dengan teruk, ia menghasilkan hingar berlabel.

Kesimpulan — Perkakasan Menamatkan Gelung; Data Memulakannya

Cengkaman yang lebih baik, kulit sentuhan dan sensor daya adalah kemajuan sebenar. Tiada satu pun daripadanya yang menghapuskan keperluan untuk set data multimodal, disegerakkan dan diberi anotasi yang kaya yang mengajar model apa maksud isyarat tersebut dalam konteks. Organisasi yang merapatkan jurang antara demo AI Fizikal dan penggunaan AI Fizikal adalah organisasi yang mengendalikan data sebagai infrastruktur kelas pertama — mengumpulnya secara sengaja, memberi anotasi dengan ketelitian domain dan memasukkan data operasi kembali ke dalam latihan sebagai gelung kekal. Perkakasan menamatkan gelung deria-putuskan-tindakan-adaptasi. Data latihan adalah apa yang memulakannya.

Ia bersifat multimodal, disegerakkan masa dan ditangkap daripada interaksi fizikal sebenar atau teleoperasi. Data latihan AI biasa biasanya teks atau imej yang dikikis secara pukal. Data latihan AI fizikal perlu merangkumi strim sensor — penglihatan, kedalaman, sentuhan, daya, propriosepsi — yang dirakam semasa sentuhan sebenar dengan objek dan persekitaran.

Kamera boleh memberitahu robot rupa objek, bukan bagaimana ia bertindak balas terhadap daya, sama ada cengkaman tergelincir, atau bagaimana bahan berubah bentuk di bawah tekanan. Manipulasi adalah masalah sentuhan. Tanpa data sentuhan dan daya dalam set latihan, model tidak mempunyai asas untuk menyesuaikan diri semasa sentuhan.

Tidak seperti imej internet, setiap titik data sentuhan memerlukan interaksi fizikal — robot atau manusia yang benar-benar menyentuh, menggenggam atau mengendalikan sesuatu. Ini menjadikan penangkapan menjadi perlahan, mahal dan sensitif terhadap penentukuran rig, jadi set data awam berskala besar masih jarang ditemui.

Simulasi adalah berharga, terutamanya untuk senario yang jarang berlaku atau berbahaya, tetapi jurang simulasi kepada sebenar kekal ketara untuk dinamik sentuhan, pematuhan bahan dan hingar sensor. Saluran latihan AI Fizikal yang paling kuat menggabungkan data sintetik dan sebenar dan bukannya bergantung pada mana-mana sahaja.

Dua tempat. Pertama, kenal pasti kegagalan pengeluaran yang didorong oleh sentuhan — gelinciran, ubah bentuk, salah jajaran — kerana data kegagalan sahaja yang boleh membetulkannya. Kedua, rancang program penangkapan yang disasarkan yang menambah modaliti yang hilang (sentuhan, daya, propriosepsi) pada tugas tertentu di mana ia akan menggerakkan jarum, daripada cuba membina semula keseluruhan set data sekaligus.

Menikmati artikel ini? Ikuti Shaip di LinkedIn untuk maklumat lanjut.

Kongsi sosial