Impelementasi Random Oversampling pada Algoritma Random Forest untuk Klasifikasi Indeks Standar Udara di DKI Jakarta 2024

Harsena Argretya, Kusnawi Kusnawi

Abstract


Polusi udara merupakan permasalahan lingkungan global yang berdampak signifikan terhadap kesehatan manusia dan ekosistem, terutama di wilayah perkotaan padat seperti DKI Jakarta. Tantangan utama tidak hanya terletak pada tingginya konsentrasi polutan, tetapi juga pada keterbatasan analisis data kualitas udara yang akurat dan seimbang. Dataset Indeks Standar Pencemar Udara (ISPU) sering mengalami ketidakseimbangan kelas, di mana sebagian besar data berada pada kategori “SEDANG,” sedangkan “BAIK” dan “TIDAK SEHAT” memiliki jumlah yang jauh lebih sedikit. Kondisi ini menyebabkan model machine learning cenderung bias terhadap kelas mayoritas. Penelitian ini menerapkan dan mengevaluasi teknik Random Oversampling (ROS) yang dikombinasikan dengan algoritma Random Forest untuk meningkatkan akurasi klasifikasi ISPU di DKI Jakarta menggunakan data tahun 2024. Tahapan penelitian meliputi pengumpulan data dari portal Satu Data Jakarta, praproses menggunakan imputasi KNN, penyeimbangan kelas dengan ROS, pelatihan model Random Forest, serta evaluasi menggunakan metrik akurasi, presisi, recall, dan F1-score. Hasil penelitian menunjukkan peningkatan akurasi dari 96,71% menjadi 97,07%, dengan recall kelas “TIDAK SEHAT” naik dari 0,93 menjadi 0,94, sedangkan kelas “BAIK” tetap di 0,88. Meskipun peningkatan tersebut relatif kecil, ROS membantu menyeimbangkan proses pembelajaran dan meningkatkan stabilitas model. Penelitian ini juga menyoroti keterbatasan ROS yang hanya menduplikasi data tanpa menghasilkan variasi baru, sehingga metode alternatif seperti SMOTE atau ADASYN disarankan untuk penelitian selanjutnya. Secara keseluruhan, integrasi Random Forest dan Random Oversampling berkontribusi dalam mendukung pemantauan kualitas udara berbasis data dan pengambilan keputusan lingkungan di wilayah perkotaan.


Keywords


Kualitas Udara, Klasifikasi ISPU, Random Forest, Random Oversampling, Ketidakseimbangan Data

Full Text:

References


R. Firdaus et al., “Implementasi Algoritma Random Forest Untuk Klasifikasi Pencemaran Udara di Wilayah Jakarta Berdasarkan Jakarta Open Data,” vol. 14, no. 2, pp. 520–525, 2021.

Rosatul Umah and Eva Gusmira, “Dampak Pencemaran Udara terhadap Kesehatan Masyarakat di Perkotaan,” Profit J. Manajemen, Bisnis dan Akunt., vol. 3, no. 3, pp. 103–112, 2024, doi: 10.58192/profit.v3i3.2246.

A. F. B. Sajiwo, B. Rahmat, and A. Junaidi, “Klasifikasi Indeks Standar Pencemaran Udaran (Ispu) Menggunakan Algoritma Xgboost Dengan Teknik Imbalanced Data (Smote),” J. Inform. dan Tek. Elektro Terap., vol. 12, no. 3, 2024, doi: 10.23960/jitet.v12i3.4699.

J. S. Dyana et al., “Dampak Bahaya Pencemaran Udara Terhadap Kesehatan Masyarakat Di Perkotaan,” vol. 11, pp. 132–140, 2025.

F. D. C.W., R. Emilia, G. G. P., and F. Indrayatna, “Klasifikasi Tingkat Pencemaran Udara Kota Jakarta Tahun 2021 Menggunakan Algoritma Decision Tree,” Pros. Nas. SNSA 2, pp. 127–131, 2023, [Online]. Available: https://www.data.jakarta.go.id/

I. Irwansyah, A. D. Wiranata, and T. T. M, “Komparasi Algoritma Decision Tree, Naive Bayes Dan K-Nearest Neighbor Untuk Menentukan Kualitas Udara Di Provinsi Dki Jakarta,” Infotech J. Technol. Inf., vol. 9, no. 2, pp. 193–198, 2023, doi: 10.37365/jti.v9i2.203.

I. M. Faiza, G. Gunawan, and W. Andriani, “Tinjauan Pustaka Sistematis: Penerapan Metode Machine Learning untuk Deteksi Bencana Banjir,” J. Minfo Polgan, vol. 11, no. 2, pp. 59–63, 2022, doi: 10.33395/jmp.v11i2.11657.

L. F. Syarifa, “Studi Komparasi Model Parametrik Dan Non-Parametrik Dalam Estimasi Efisiensi Teknis Perkebunan Karet Rakyat Di Sumatera Selatan,” J. Penelit. Karet, vol. 38, no. 2, pp. 189–196, 2020, doi: 10.22302/ppk.jpk.v2i38.736.

B. V. Jayadi, M. D. Lauro, Z. Rusdi, T. Handhayani, and F. T. Informasi, “Klasifikasi Indeks Standar Pencemaran Udara untuk Data Tidak Seimbang menggunakan Pendekatan Pembelajaran Mesin,” J. Sist. Inf., vol. 13, no. 3, pp. 951–958, 2024, [Online]. Available: http://sistemasi.ftik.unisi.ac.id

D. Javale, P. Pillai, P. Patel, and S. Jagtap, “A Comparison of Oversampling and Undersampling Methods for Predicting Air Quality in Metropolitan Region,” Proc. - Int. Conf. Appl. Artif. Intell. Comput. ICAAIC 2022, no. January, pp. 1615–1620, 2022, doi: 10.1109/ICAAIC53929.2022.9793084.

A. H. Putra and A. Salam, “A Comparative Performance of SMOTE, ADASYN and Random Oversampling in Machine Learning Models on Prostate Cancer Dataset,” J. Appl. Informatics Comput., vol. 9, no. 3, pp. 603–610, 2025, doi: 10.30871/jaic.v9i3.9308.

W. Chandra, B. Suprihatin, and Y. Resti, “Median-KNN Regressor-SMOTE-Tomek Links for Handling Missing and Imbalanced Data in Air Quality Prediction,” Symmetry (Basel)., vol. 15, no. 4, 2023, doi: 10.3390/sym15040887.

F. Yulian Pamuji, Ahmad Rofiqul Muslikh, Rizza Muhammad Arief, and Delviana Muti, “Komparasi Metode Mean dan KNN Imputation dalam Mengatasi Missing Value pada Dataset Kecil,” J. Inform. Polinema, vol. 10, no. 2, pp. 257–264, 2024, doi: 10.33795/jip.v10i2.5031.

G. Li, C. Wang, D. Zhang, and G. Yang, “An improved feature selection method based on random forest algorithm for wind turbine condition monitoring,” Sensors, vol. 21, no. 16, pp. 1–11, 2021, doi: 10.3390/s21165654.

N. A. Prakoso Indaryono, “Analisa Perbandingan Algoritma Random Forest Dan Naïve Bayes Untuk Klasifikasi Curah Hujan Berdasarkan Iklim Di Indonesia,” JIPI (Jurnal Ilm. Penelit. dan Pembelajaran Inform., vol. 9, no. 1, pp. 158–167, 2024, doi: 10.29100/jipi.v9i1.4421.

F. Diba, M. S. Lydia, and P. Sihombing, “Analisis Random Forest Menggunakan Principal Component Analysis Pada Data Berdimensi Tinggi,” Indones. J. Comput. Sci., vol. 12, no. 4, pp. 2152–2160, 2023, doi: 10.33022/ijcs.v12i4.3329.

M. A. N. Anargya, W. Ghozi, and F. A. Rafrastara, “Random Under Sampling for Performance Improvement in Attack Detection on Internet of Vehicles Using Machine Learning,” J. Inform. J. Pengemb. IT, vol. 10, no. 1, pp. 11–19, 2025, doi: 10.30591/jpit.v10i1.8034.

F. Hanifatun and L. Zahrotun, “Jurnal Informatika : Jurnal pengembangan IT Penerapan Data Mining Dalam Pemberian Kelayakan Kredit Nasabah Pada Badan Usaha Milik Desa Gedong Gincu Dengan Metode Naïve Bayes,” vol. 10, no. 1, pp. 226–236, 2025, doi: 10.30591/jpit.v9ix.xxx.

S. Syihabuddin Azmil Umri, “Prediksi Kualitas Udara Menggunakan Algoritma K-Nearest Neighbor,” JIKO (Jurnal Inform. dan Komputer), vol. 4, no. 2, pp. 98–104, 2021, doi: 10.33387/jiko.v4i2.2871.




DOI: https://doi.org/10.30591/jpit.v10i4.9466

Refbacks

  • There are currently no refbacks.


Creative Commons License
This work is licensed under a Creative Commons Attribution 4.0 International License.

JPIT INDEXED BY

  
  

Creative Commons License
This work is licensed under a Creative Commons Attribution 4.0 International License.