Segmentasi Teks Arab Pegon Menggunakan Histogram Segmentation

Muhammad Fikri Hidayattullah, Sharfina Febbi Handayani, Yustia Hapsari, M. Ibrahim Hanif

Abstract


Aksara Pegon merupakan salah satu warisan budaya Nusantara yang memiliki nilai sejarah tinggi, terutama dalam literatur Islam di Jawa, Sunda dan Madura. Upaya digitalisasi naskah Pegon menghadapi sejumlah kendala yang tidak sederhana. Kompleksitas bentuk huruf, pola penyambungan antarhuruf, serta ketidakteraturan tata letak tulisan pada manuskrip kuno menjadikan proses ekstraksi teks jauh lebih menantang dibandingkan teks cetak modern.  Salah satu tahapan yang sangat penting dalam proses tersebut adalah segmentasi teks. Ketepatan pemisahan karakter atau kata akan sangat menentukan keberhasilan tahap berikutnya, yaitu Optical Character Recognition (OCR) dan transliterasi otomatis. Histogram segmentation dikenal mampu mendeteksi dan memisahkan objek teks dari latar belakang dengan memanfaatkan distribusi intensitas piksel. Metode ini sudah dikenal luas dalam segmentasi citra digital. Cara kerjanya yang sederhana tanpa memerlukan pelatihan, membuat metode ini cocok digunakan sebagai langkah awal menuju tahap transliterasi aksara Arab-Pegon. Hasil eksperimen menunjukkan bahwa model mampu melakukan segmentasi baris dengan baik. Sedangkan tingkat akurasi segmentasi kata sebesar 70% dengan error rate Over-Segmentation Rate (OSR) sebesar 0.20  dan Under-Segmentation Rate (USR) sebesar 0.13. Metode histogram segmentation terbukti ringan, cukup efisien, dan tidak memerlukan pelatihan data seperti pada pendekatan deep learning. Penelitian ini memiliki kontribusi besar terhadap pelestarian aksara Arab-Pegon sebagai khazanah ilmu pengetahuan yang dimiliki oleh nusantara.

Keywords


Aksara Pegon, Digitalisasi Naskah, Histogram Segmentation, OCR, Pengolahan Citra

Full Text:

References


Y. Yuliani, “Aksara Tafsir Al-Qur’an Di Priangan:Huruf Pegon Dan Aksara Latin Dalam Karya K.H. Ahmad Sanoesi,” Al-Bayan J. Stud. Ilmu Al- Qur’an dan Tafsir, vol. 5, no. 1, 2020.

I. Gusmian, “Bahasa dan Aksara Dalam Penulisan Tafsir Al-Qur’an di Indonesia Era Awal Abad 20 M,” Mutawâtir J. Keilmuan Tafsir Hadis, vol. 5, no. 2, p. 223, Sep. 2015.

R. Rusyadi, Bahasa Arab Pesantren: Sejarah dan Tradisi Literasi Pegon di Nusantara, Pertama. Malang: Madza Media, 2021.

I. R. N. Hula, A. Helingo, S. N. A. Jassin, and S. Sarif, “Transcription of Pegon Gorontalo Arabic Orthography, Malay and Arabic Standard: A Contraceptive Linguistic Analysis,” `A Jamiy J. Bhs. dan Sastra Arab, vol. 11, no. 2, p. 322, 2022.

D. Syafaah, N. B. Rohmah, and U. Rejo, “Pemulihan warisan budaya: desain laboratorium filologi sebagai pusat pembelajaran manuskrip keislaman jawa pesisir,” Humanika, vol. 31, no. 1, pp. 1–15, 2024.

Elmustian and M. Firdaus, “Filologi, Transformasi Teks, dan Filsafat Pendidikan: Strategi Pelestarian Budaya dalam Konteks Pendidikan Kontemporer,” Indones. Res. J. Educ., vol. 4, no. 4, 2024.

E. Purnama, “Pelestarian Koleksi Buku Langka Di Perpustakaan Universitas Gadjah Mada,” J. Multidisipliner Kapalamada, vol. 2, no. 04, pp. 227–239, 2023.

Y. Ruldeviyani, H. Suhartanto, B. A. Sotardodo, M. H. Fahreza, A. Septiano, and M. F. Rachmadi, “Character recognition system for pegon typed manuscript,” Heliyon, vol. 10, no. 16, p. e35959, 2024.

N. A. Jebril, H. R. Al-Zoubi, and Q. Abu Al-Haija, “Recognition of Handwritten Arabic Characters using Histograms of Oriented Gradient (HOG),” Pattern Recognit. Image Anal., vol. 28, no. 2, pp. 321–345, 2018.

S. Alghyaline, “Arabic Optical Character Recognition: A Review,” C. - Comput. Model. Eng. Sci., vol. 135, no. 3, pp. 1825–1861, 2023.

I. Saleh Al-Sheikh, M. Mohd, and L. Warlina, “A Review of Arabic Text Recognition Dataset,” Asia-Pacific J. Inf. Technol. Multimed., vol. 09, no. 01, pp. 69–81, 2020.

M. N. Elagamy, M. M. Khalil, and E. Ismail, “HACR-MDL: Handwritten Arabic Character Recognition Model Using Deep Learning,” ISPRS Ann. Photogramm. Remote Sens. Spat. Inf. Sci., vol. 10, no. 1-W1-2023, pp. 123–128, 2023.

S. I. Saleem, A. M. Abdulazeez, and Z. Orman, “A new segmentation framework for arabic handwritten text using machine learning techniques,” Comput. Mater. Contin., vol. 68, no. 2, pp. 2727–2754, 2021.

H. A. Al Hamad, L. Abualigah, M. Shehab, K. H. A. Al-Shqeerat, and M. Otair, “Improved linear density technique for segmentation in Arabic handwritten text recognition,” Multimed. Tools Appl., vol. 81, no. 20, pp. 28531–28558, Aug. 2022.

A. Mostafa et al., “An End-to-End OCR Framework for Robust Arabic-Handwriting Recognition using a Novel Transformers-based Model and an Innovative 270 Million-Words Multi-Font Corpus of Classical Arabic with Diacritics,” pp. 1–31, 2022.




DOI: https://doi.org/10.30591/jpit.v10i4.9994

Refbacks

  • There are currently no refbacks.


Creative Commons License
This work is licensed under a Creative Commons Attribution 4.0 International License.

JPIT INDEXED BY

  
  

Creative Commons License
This work is licensed under a Creative Commons Attribution 4.0 International License.