Kajian Kes Pengumpulan Data Pertuturan Bahasa India: 300 Jam Merentasi Bahasa Hindi, Telugu & Bahasa Inggeris
Menawarkan perkhidmatan pengumpulan data audio, transkripsi dan anotasi berkualiti tinggi untuk melatih Suite Suara berbilang bahasa Pemprosesan Pertuturan berkuasa AI mereka.
Gambaran Keseluruhan Projek: Data Pertuturan untuk Platform Penyetempatan Bahasa India
Pelanggan membina teknologi yang merapatkan jurang bahasa dalam dunia digital. Kandungan daripada aplikasi dan portal boleh dihantar dalam pelbagai bahasa dalam masa nyata melalui platform Bahasa-sebagai-Perkhidmatan mereka. Platform Bahasa menyediakan kandungan statik dan dinamik daripada aplikasi dan portal dalam pelbagai bahasa dalam masa nyata.
Mereka menyediakan penyetempatan bahasa merentasi beberapa pelanggan seperti jenama mudah alih, pengeluar cipset, Internet pengguna, bank dan institusi kewangan, kerajaan pendidikan, hiburan dan banyak lagi.
Keputusan Utama: 300 Jam Dikumpulkan Merentasi 3 Bahasa
Data Audio Dikumpul, Ditranskripsikan dan Dianotasi
300 Jam
No.
Bahasa
3 (100 jam x 3 bahasa)
Bahasa yang Ditranskripsikan & Dianotasi
India, Inggeris, Hindi, Telugu
Projek
Timeline
12 Minggu
Cabaran: Mencari Pertuturan Perbualan yang Pelbagai Secara Demografi
Kekurangan akses kepada ahli bahasa yang berkualiti, pakar anotasi data dan garis masa yang ketat telah menjadi penghalang dalam kemajuan dan penggunaan AI perbualan. Mencari sumber ahli bahasa, menyalin dan menganotasi set data dalam jumlah besar dengan kualiti yang diperlukan, cukup mencukupi untuk membina keupayaan AI, adalah tugas yang memakan masa dan mahal yang memerlukan sumber mahir daripada pelbagai domain.
Keperluan kritikal pelanggan adalah:
- Akses kepada Ahli Bahasa Berkualiti untuk Koleksi Audio: Kumpulkan 300 jam audio untuk bahasa seperti India, Inggeris, Hindi & Telugu daripada pakar bahasa dengan kepelbagaian demografi.
- Transkripsi & Anotasi Audio Kompleks dengan ketepatan minimum 90%:
- Menyalin keseluruhan fail audio, menangkap semua perkataan yang dituturkan – termasuk teragak-agak, perkataan pengisi, permulaan salah dan tik lisan yang lain
- Memberikan output bebas ralat meskipun terdapat garis panduan transkripsi yang ketat yang berkaitan dengan sebutan dialek, perkataan yang salah sebut, penggunaan yang tidak standard dan tanda baca.
- Penghantaran Data: Penghantaran fail audio yang berkualiti tinggi dan pelbagai berserta transkrip yang sepadan (format JSON) untuk 3 bahasa dalam tempoh masa 12 minggu.
Penyelesaiannya: Koleksi Audio Khusus Domain, Transkripsi & Anotasi
Dengan pemahaman mendalam kami tentang AI perbualan, kami telah membantu pelanggan mengumpul, menyalin dan memberi anotasi data oleh pasukan pakar bahasa dan anotator untuk melatih Suite Suara berbilang bahasa berkuasa AI mereka.
Selepas menilai ramai vendor, pelanggan memilih Shaip kerana kepakaran kami dalam menyelesaikan projek AI perbualan dalam tempoh masa yang ketat, kos efektif dan kualiti yang diperlukan. Pasukan mereka juga kagum dengan keupayaan pelaksanaan projek Shaip yang mantap dan komprehensif.
| Bahasa | Bilangan Jam | Perbualan Umum Tanpa Skrip (50%) | Perbualan Pusat Panggilan Tanpa Skrip (30%) | Kandungan Media Terbuang Dalam Talian (20%) |
|---|---|---|---|---|
| Hindi | 100 | 50 | 30 | 20 |
| Bahasa Inggeris | 100 | 50 | 30 | 20 |
| Telegu | 100 | 50 | 30 | 20 |
| Jumlah | 300 | 150 | 90 | 60 |
- Keperluan Pengumpulan Audio Tambahan
- Frekuensi: Kadar persampelan – 16 kHz
- Format: WAV
- Tempoh – Tempoh umum (5-30 minit) – perbualan
- Domain Pertuturan – BFSI, Telekom dan Runcit
- Kepelbagaian Demografi – Jantina: Nisbah 1:1, Julat Umur: 18-60, Tangkap ID Pembesar Suara untuk mengenal pasti setiap Pembesar Suara yang unik
- Garis Panduan Segmentasi, Transkripsi & Anotasi Audio telah dipatuhi
2.1 Segmentasi- Cipta segmen 15 saat setiap satu (dicap masa kepada milisaat) untuk fail individu yang lebih besar daripada 30 saat
- Jenis Bunyi Segmen – pertuturan, celoteh, muzik, hingar, pertindihan
- Pelabelan Segmen – masa mula, masa tamat, ID segmen, tahap kenyaringan, jenis bunyi utama,
kod bahasa, ID penutur
2.2 Transkripsi & Anotasi- Mentranskripsikan keseluruhan fail audio, menangkap semua perkataan yang dituturkan – termasuk teragak-agak, perkataan pengisi, permulaan salah dan tik lisan lain seperti simbol, aksara
- Memberikan output bebas ralat meskipun terdapat garis panduan transkripsi yang ketat berkaitan dengan sebutan dialek, perkataan yang salah sebut, penggunaan yang tidak standard, tanda baca, penggunaan huruf besar, singkatan, pengecutan, nombor, akronim, pertuturan yang tidak fasih & tidak difahami, dan bukan sasaran.
bahasa, dan banyak lagi.
- Penghantaran Data
Semua fail audio dan transkrip WAV dihantar dalam format JSON mengikut demografi penceramah unik yang disertakan dalam tempoh 12 minggu.
Hasilnya: Suit Suara Berbilang Bahasa yang Sedia untuk Produksi
Data audio beranotasi berkualiti tinggi daripada pakar bahasa telah membolehkan pelanggan melatih Suite Suara berbilang bahasa Pemprosesan Pertuturan berkuasa AI mereka dengan tepat dalam 3 bahasa iaitu India, Inggeris, Hindi & Telugu dalam masa yang ditetapkan.
Dengan set data latihan standard emas, pelanggan dapat menawarkan perkhidmatan Pertuturan-ke-teks, terjemahan bahasa & pad kekunci berbilang bahasa yang pintar dan mantap untuk menyelesaikan masalah dunia sebenar.
Kami kagum dengan keupayaan pelaksanaan projek Shaip yang mantap, kepakaran mereka untuk mendapatkan, menyalin dan memberi anotasi data audio yang diperlukan daripada pakar bahasa. Pelbagai pemeriksaan kualiti, pematuhan kepada garis masa yang ketat dan kepimpinan nilai kos yang mereka tawarkan tiada tandingan.