Pengecaman aksara optik kini memperkasakan pengimbasan resit, pengesahan ID, automasi invois, pendigitalan arkib sejarah dan aplikasi nota berasaskan stylus. Pasaran OCR diunjurkan mencecah $32.90 bilion menjelang 2030 pada CAGR 14.8% (Grand View Research, 2024), dengan pengecaman aksara pintar — cabang OCR yang membaca tulisan tangan — berkembang paling pesat. Sama ada anda membina penghuraian dokumen, pengesanan teks pemandangan atau transkripsi tulisan tangan, set data OCR yang anda latih menetapkan had ketepatan anda. Panduan ini merangkumi 22 set data OCR sumber terbuka percuma — termasuk set data tulisan tangan terbaik — disusun mengikut kes penggunaan dan dikemas kini dengan keluaran terkuat sehingga 2024.
Poin-poin utama
- OCR (Pengecaman Aksara Optik): teknologi yang menukar imej teks bercetak, pemandangan atau tulisan tangan kepada data yang boleh dibaca mesin.
- Set data OCR dibahagikan kepada lima kumpulan: dokumen/borang, teks adegan, digit/aksara, tulisan tangan dan berbilang bahasa.
- Dokumenkan set data OCR rakam halaman berstruktur seperti borang dan resit; set data teks pemandangan menangkap teks "di alam liar".
- IAM, MNIST, ICDAR dan SROIE kekal sebagai penanda aras OCR yang paling banyak disebut dalam penyelidikan.
- Terma lesen berbeza-beza secara meluas — sahkan setiap set data OCR sebelum latihan komersial.
Apakah itu OCR (Pengecaman Aksara Optik)?
OCR ialah teknologi yang menukarkan pelbagai jenis dokumen, seperti dokumen kertas yang diimbas, PDF atau imej teks, kepada data yang boleh diedit dan dicari. Ia berfungsi dengan:
- Menganalisis struktur teks dalam imej
- Memecahkan teks kepada baris dan aksara
- Menukar aksara visual ini kepada teks yang boleh dibaca mesin
Kegunaan biasa termasuk:
- Menukar dokumen yang diimbas kepada fail teks boleh diedit
- Mendigitalkan buku bercetak
- Mengekstrak teks daripada foto
- Menukar preskripsi tulisan tangan kepada teks digital
- Pengiktirafan plat lesen
Bagaimanakah anda memilih set data OCR yang betul?
Memilih set data OCR bergantung kepada empat faktor: jenis teks, persekitaran tangkapan, kebutiran anotasi dan lesen. OCR dokumen bercetak memerlukan data latihan yang berbeza daripada teks adegan kursif atau melengkung tulisan tangan. Set data dokumen sesuai dengan invois, borang dan resit; set data teks adegan sesuai dengan papan tanda dan bacaan produk; set data tulisan tangan sesuai dengan nota, manuskrip dan input stylus. Anotasi peringkat perkataan dan peringkat baris menyokong saluran paip OCR penuh, manakala set peringkat aksara sesuai dengan garis dasar pengelasan. Sentiasa sahkan terma lesen, kerana sesetengah set data OCR adalah untuk penyelidikan sahaja atau memerlukan pendaftaran.
Apakah set data OCR dokumen dan borang yang terbaik?
Set data OCR dokumen melatih model untuk menghuraikan halaman berstruktur seperti invois, borang, resit dan ID. Ini memperkasakan automasi dokumen perniagaan dan pengekstrakan nilai kunci.
- FUNSD — 199 borang imbasan beranotasi dengan penampilan dunia sebenar yang bising. Penanda aras standard untuk pemahaman borang dan pengekstrakan nilai kunci.
- SROIE — Set data resit imbasan ICDAR 2019 yang mengandungi kira-kira 1,000 resit, menyokong pengesanan teks, pengecaman dan pengekstrakan maklumat dalam satu set.
- KATA — Set data resit tergabung yang dibina untuk penghuraian pasca-OCR, dengan label peringkat medan yang kaya untuk automasi invois dan resit.
- XFUND — Lanjutan berbilang bahasa FUNSD yang meliputi tujuh bahasa (Jerman, Sepanyol, Perancis, Itali, Jepun, Portugis, Cina) dengan 199 halaman setiap satu. Sesuai untuk dokumen AI berbilang bahasa.
- DDI-100 — Kira-kira 100,000 imej dokumen yang herot untuk pengesanan dan pengecaman di bawah degradasi dunia sebenar seperti condong, kabur dan hingar.
Apakah set data OCR teks babak terbaik?
Set data OCR teks-adegan melatih model untuk membaca teks dalam imej semula jadi seperti papan tanda, produk dan pemandangan jalanan. Ini penting untuk OCR dalam alam semula jadi di mana latar belakang berselerak.
- Bacaan Teguh ICDAR — Keluarga penanda aras di sebalik kebanyakan penyelidikan teks adegan, termasuk cabaran Teks Adegan Terfokus dan Sampingan dengan kotak sempadan dan transkripsi peringkat perkataan.
- Teks COCO — Anotasi teks adegan berskala besar berlapis pada imej MS-COCO. Kuat untuk pengesanan teks pada skala dalam adegan semula jadi.
- Teks Keseluruhan — Mengkhusus dalam teks melengkung dan berorientasikan sewenang-wenangnya, kelemahan yang diketahui untuk model OCR lama.
- SVT (Teks Paparan Jalan) — Imej Word diambil daripada Google Street View, selalunya beresolusi rendah dan mempunyai kepelbagaian yang tinggi. Tersedia melalui Papers with Code mirror.
- HierTeks — Anotasi hierarki dari perenggan ke baris ke perkataan, meliputi teks adegan tulisan tangan dan bercetak. Berguna untuk OCR yang peka susun atur.
Apakah set data OCR digit dan aksara yang terbaik?
Set data OCR digit dan aksara melatih model untuk mengenali simbol individu dalam tetapan terkawal. Ini adalah titik permulaan standard untuk garis dasar pengelasan.
- MNIST — 70,000 imej digit tulisan tangan skala kelabu. Garis dasar terpantas untuk mengesahkan pengelas digit.
- EMNIST — Memperluas MNIST dengan 814,255 huruf dan digit tulisan tangan yang diperoleh daripada Pangkalan Data Khas NIST 19.
- SVHN (Nombor Rumah Street View) — Lebih 600,000 imej digit dunia sebenar daripada nombor rumah. Satu langkah praktikal daripada MNIST untuk keadaan bising.
- Chars74K — 74,107 imej yang meliputi aksara Inggeris dan Kannada daripada imej semula jadi dan fon komputer.
- Pangkalan Data Khas NIST 19 — 810,000+ imej aksara cetakan tangan daripada 3,600 penulis. Sumber yang digunakan untuk penanda aras OCR Bahasa Inggeris.
Apakah set data tulisan tangan terbaik untuk OCR?
Set data tulisan tangan melatih model OCR untuk membaca teks tulisan tangan kursif, bercetak dan bersejarah. Set data tulisan tangan terbuka yang paling kukuh kekal sebagai penanda aras yang paling banyak dipetik untuk pengecaman teks tulisan tangan (HTR).
- Pangkalan Data Tulisan Tangan IAM — Piawaian emas tulisan tangan Inggeris, dengan 13,353 baris teks daripada 657 penulis. Masih merupakan set data tulisan tangan yang paling banyak dipetik dalam penyelidikan OCR 2024–2025.
- IAM-OnDB — Versi IAM dalam talian yang menggunakan lejang pena, yang merekodkan data trajektori. Set data tulisan tangan kanonik untuk pengecaman stylus dan tablet.
- Kertas Bentham — Manuskrip sejarah Inggeris yang ditranskripsikan daripada ahli falsafah Jeremy Bentham. Penanda aras utama untuk tulisan tangan sejarah OCR, boleh diakses melalui Transkribus.
- GNHK (Koleksi Tulisan Tangan GoodNotes) — Set data nota tulisan tangan Bahasa Inggeris dunia sebenar yang tidak terhad pada tahun 2021. Lebih hampir kepada data pengeluaran yang tidak kemas berbanding IAM yang bersih di makmal.
Apakah set data OCR berbilang bahasa dan bukan Latin yang terbaik?
Set data OCR berbilang bahasa melatih model skrip melangkaui bahasa Inggeris, termasuk notasi bahasa Cina, Arab dan matematik. Ini penting untuk pengecaman dokumen dan tulisan tangan global.
- CASIA-HWDB — Penanda aras OCR Cina standard, dengan 1.17 juta sampel aksara tulisan tangan daripada 1,020 penulis.
- KHATT — 1,000 borang tulisan tangan Arab daripada 1,000 penulis berbeza, diimbas pada pelbagai resolusi. Set data OCR Arab terbuka yang paling komprehensif.
- CROHME — Pertandingan Pengecaman Ungkapan Matematik Tulisan Tangan Dalam Talian: 10,000+ ungkapan merentasi 101+ simbol matematik, dalam varian dalam talian dan luar talian. Penting untuk OCR persamaan tulisan tangan.
Apakah kelemahan biasa apabila menggunakan set data OCR percuma?
Tiga perangkap yang menjejaskan kebanyakan pasukan.
Ketidakpadanan domain: Latihan tentang IAM atau COCO-Text yang bersih dan penggunaan pada invois yang renyuk menjamin ketepatan yang lemah.
Buta lesen: Beberapa set data OCR teks adegan dan sejarah hanyalah untuk penyelidikan sahaja atau memerlukan pendaftaran sebelum penggunaan komersial.
Jurang anotasi: banyak set data OCR kekurangan metadata susun atur, kotak sempadan aras baris atau label medan yang diperlukan oleh sistem pengeluaran.
Bayangkan sebuah firma logistik bersaiz sederhana yang mengautomasikan pembacaan label penghantaran. Latihan teks pemandangan awam membolehkan mereka mencapai 80% pada penanda aras, tetapi label sebenar dengan silau dan lipatan menurunkannya kepada 58%. Merapatkan jurang itu memerlukan sasaran yang disasarkan. anotasi data daripada 6,000 imej label dalam domain sebelum pelancaran.
Faedah dan Cabaran Set Data Sumber Terbuka
Perniagaan perlu membandingkan manfaat dan cabaran antara satu sama lain untuk memahami sama ada mereka mesti memilih data percuma untuk digunakan untuk aplikasi ML mereka.
Faedah
- Data tersedia dengan mudah untuk diakses. Oleh kerana ketersediaan data, kos membangunkan aplikasi dikurangkan dengan ketara.
- Masa dan usaha yang dibelanjakan untuk mengumpul data untuk aplikasi dikurangkan dengan ketara kerana set data tersedia.
- Terdapat banyak forum komuniti atau kumpulan bantuan yang membantu mempelajari, menyesuaikan dan mengoptimumkan set data.
- Salah satu kelebihan utama dataset sumber terbuka ialah ia tidak meletakkan sebarang sekatan pada penyesuaian.
- Data Sumber Terbuka boleh diakses oleh sebahagian besar populasi, menjadikan analisis dan inovasi mungkin tanpa halangan kewangan.
Cabaran
- Data khusus untuk projek itu sukar diperoleh. Selain itu, terdapat kemungkinan kehilangan maklumat dan penggunaan data yang tersedia secara salah.
- Memperoleh data proprietari memerlukan masa, dan usaha serta memerlukan kos yang tinggi
- Walaupun mungkin lebih mudah untuk memperoleh data, pengetahuan dan kos analisis mungkin melebihi kelebihan awal.
- Pembangun lain juga menggunakan data yang sama untuk membangunkan aplikasi.
- Set data ini sangat terdedah kepada pelanggaran keselamatan, privasi dan persetujuan.
Bagaimanakah Shaip menyokong projek OCR dan pengecaman tulisan tangan?
milik Shaip Perkhidmatan data latihan OCR pasangkan kurasi set data terbuka dengan tersuai pengumpulan data merentasi 60+ bahasa, merangkumi dokumen bercetak, tulisan tangan, resit dan ID. Aliran kerja anotasi Shaip menambah lapisan yang terlepas pandang oleh set data OCR awam: kotak sempadan peringkat baris, label peringkat medan, QC transkripsi dan metadata penulis.
Kesimpulan
22 set data OCR di atas memberikan anda asas sumber terbuka yang lengkap merentasi dokumen, teks pemandangan, digit, tulisan tangan dan pengecaman berbilang bahasa untuk tahun 2026. Mulakan dengan set data OCR yang sepadan dengan jenis teks dan persekitaran tangkapan anda, sahkan terhadap sampel data sebenar anda yang ditahan dan bajetkan untuk anotasi tersuai bagi menutup jurang domain. Gabungan itu dihantar lebih pantas daripada membina dari awal.
Apakah set data OCR percuma terbaik untuk pembelajaran mesin?
Set data OCR percuma terbaik bergantung pada tugasan. ICDAR Robust Reading mengetuai teks pemandangan, FUNSD dan SROIE mengetuai OCR dokumen dan resit, dan IAM mengetuai tulisan tangan. Untuk pengecaman digit, MNIST dan SVHN adalah standard. Kebanyakan pasukan menggabungkan dua atau tiga set data OCR merentasi kategori dan bukannya bergantung pada satu set data.
Adakah set data OCR sumber terbuka percuma untuk kegunaan komersial?
Set data OCR sumber terbuka tidak semuanya percuma untuk kegunaan komersial. MNIST, SVHN dan COCO-Text menggunakan lesen permisif, manakala set IAM, ICDAR dan set data tulisan tangan sejarah selalunya memerlukan pendaftaran atau menyekat penggunaan untuk penyelidikan. Sentiasa semak lesen setiap set data sebelum melatih model komersial.
Apakah perbezaan antara set data OCR dan set data tulisan tangan?
Set data OCR merangkumi semua pengecaman teks yang boleh dibaca mesin, termasuk dokumen bercetak, teks pemandangan dan digit, manakala set data tulisan tangan adalah subset yang tertumpu pada kandungan tulisan tangan. Set data tulisan tangan seperti IAM dan Bentham melatih model HTR, manakala set data OCR dokumen dan teks pemandangan mengendalikan teks bercetak dan teks sedia ada.
Set data OCR yang manakah menyokong pengecaman berbilang bahasa?
Set data OCR berbilang bahasa termasuk XFUND untuk tujuh bahasa borang, CASIA-HWDB untuk bahasa Cina, KHATT untuk bahasa Arab dan ICDAR MLT untuk teks adegan berbilang bahasa. Menggabungkan set data OCR khusus skrip dengan augmentasi sintetik biasanya mengatasi latihan pada mana-mana set data tunggal sahaja.
Berapa banyak anotasi tersuai yang saya perlukan selain daripada set data OCR percuma?
Keperluan anotasi tersuai bergantung pada sejauh mana dokumen anda daripada data awam. Borang bercetak yang bersih mungkin memerlukan 1,000–5,000 sampel dalam domain, manakala tulisan tangan yang tidak kemas, resit atau skrip yang jarang ditemui selalunya memerlukan 10,000–50,000. Saluran anotasi Shaip biasanya memberikan peningkatan ketepatan 15–30% berbanding latihan OCR awam sahaja.



