Perbandingan CNN-BiLSTM dan CNN-BiGRU untuk Klasifikasi Berita Indonesia Menggunakan Fast Text Embedding dan Confidence Based Pseudo Labeling

Authors

  • Cindy Rahmayanti Universitas Halu Oleo
  • Elisa Wulan Sari Universitas Halu Oleo
  • Adha Mashur Sajiah Universitas Halu Oleo

DOI:

https://doi.org/10.70404/ketik.v3i06.697

Keywords:

Klasifikasi Teks, CNN, LSTM, GRU, Fast Text, Pseudo Labeling

Abstract

Klasifikasi teks berita Indonesia merupakan tugas penting dalam pemrosesan bahasa alami yang mendukung pengelolaan informasi di era digital. Penelitian ini mengusulkan perbandingan dua arsitektur deep learning, yaitu CNN-BiLSTM dan CNN-BiGRU, yang diintegrasikan dengan word embedding FastText bahasa Indonesia dan strategi semi-supervised learning berbasis Confidence-Based Pseudo-Labeling. Dataset yang digunakan adalah Indonesian News Dataset sebanyak 91.017 artikel dari 9 kategori, yang kemudian diseimbangkan menggunakan undersampling menjadi 21.924 sampel. Sebanyak 20% data digunakan sebagai data berlabel dan 80% sisanya diperlakukan sebagai data tak berlabel yang dimanfaatkan melalui tiga iterasi pseudo-labeling dengan ambang kepercayaan adaptif (0,85; 0,88; 0,90). Hasil evaluasi menunjukkan menunjukkan bahwa penerapan pseudo-labeling secara konsisten meningkatkan performa kedua model. CNN-BiLSTM mencapai akurasi 71,72% dan F1-score 71,60% setelah pseudo-labeling, sedangkan CNN-BiGRU mencapai akurasi 69,42% dan F1-score 69,19%. Temuan ini membuktikan bahwa pendekatan semi-supervised learning efektif digunakan pada kondisi data berlabel yang terbatas.

Downloads

Download data is not yet available.

References

Y. LeCun, Y. Bengio, dan G. Hinton, "Deep learning," Nature, vol. 521, no. 7553, hal. 436-444, 2015.

C. Guridno, A. Azimah, and S. Ningsih, "Analisis Hybrid Metode CNN dan LSTM dalam Media Berita Online Indonesia," Jurnal Sistem Informasi Bisnis (JUNSIBI), vol. 5, no. 1, pp. 86–101, 2024, doi: 10.55122/junsibi.v5i1.1202.

G. A. M. K. Jaluwana, G. M. A. Sasmita, and I. M. A. D. Suarjaya, "Analysis of Public Sentiment Towards Government Efforts to Break the Chain of Covid-19 Transmission in Indonesia Using CNN and Bidirectional LSTM," Jurnal RESTI: Rekayasa Sistem dan Teknologi Informasi, vol. 6, no. 4, pp. 511–520, 2022, doi: 10.29207/resti.v6i4.4055.

F. Hanif, T. B. Sasongko, and A. D. Laksito, "Perbandingan Kinerja LSTM, Bi-LSTM, dan GRU pada Klasifikasi Judul Berita Clickbait," Indonesian Journal of Computer Science, vol. 12, no. 4, p. 2136, 2023.

W. Widayat, "Analisis Sentimen Movie Review Menggunakan Word2Vec dan Metode LSTM Deep Learning," Jurnal Media Informasi Budidarma, vol. 5, no 3, p. 1018, 2021, doi: 10.30865/mib.v5i3.3111

Nurdin et al., " Perbandingan Kinerja Word Embedding Word2Vec, GloVe, dan FastText pada Klasifikasi Teks," Jurnal Tekno Kompak, vol. 14, no. 2, pp. 74–79, 2020, doi: 10.33365/jtk.v14i2.732

Yohana et al., "Pengaruh Hyperparameter pada FastText Terhadap Performa Model Deteksi Sarkasme Berbasis Bi-LSTM," JATISI: Jurnal Teknik Informatika dan Sistem Informasi, vol. 9, no. 3, pp. 2612–2624, 2022.

R. Yang et al., "CNN-LSTM Deep Learning Architecture for Computer Vision-Based Modal Frequency Detection," Mechanical Systems and Signal Processing, vol. 168, 2022, doi: 10.1016/j.ymssp.2021.108657.

D.-H. Lee, "Pseudo-Label: The Simple and Efficient Semi-Supervised Learning Method for Deep Neural Networks," Workshop on Challenges in Representation Learning, ICML, vol. 3, p. 896, 2013.

M. D. Purbolaksono, C. Rheza, A. Munandar, dan A. Bijaksana, "Analisis sentimen pada ulasan aplikasi mobile banking menggunakan metode LSTM berbasis IndoBERT," Jurnal Informatika dan Sistem Informasi, vol. 3, no. 2, hal. 112–121, 2022.

E. Grave, P. Bojanowski, P. Gupta, A. Joulin, and T. Mikolov, "Learning Word Vectors for 157 Languages," in Proc. International Conference on Language Resources and Evaluation (LREC 2018), 2018.

M. N. Rizve, K. Duarte, Y. S. Rawat, and M. Shah, "In Defense of Pseudo-Labeling: An Uncertainty-Aware Pseudo-Label Selection Framework for Semi-Supervised Learning," arXiv preprint arXiv:2101.06329, 2021.

A. Joulin, E. Grave, P. Bojanowski, and T. Mikolov, "Bag of Tricks for Efficient Text Classification," arXiv preprint arXiv:1607.01759, 2016.

M. A. Fathin, Y. Sibaroni, and S. S. Prasetyowati, "Handling Imbalance Dataset on Hoax Indonesian Political News Classification using IndoBERT and Random Sampling," Jurnal Media Informasi Budidarma, vol. 8, no. 1, p. 352, 2024, doi: 10.30865/mib.v8i1.7099.

A. H. Syahlan, A. W. Hisbullah, and M. Wildan, "Klasifikasi Bahasa Menggunakan FastText," AI Dan SPK: Jurnal Artificial Intelligent Dan Sistem Penunjang Keputusan, vol. 3, no. 2, pp. 284–289, 2025.

Downloads

Published

30-06-2026

How to Cite

Cindy Rahmayanti, Elisa Wulan Sari, & Adha Mashur Sajiah. (2026). Perbandingan CNN-BiLSTM dan CNN-BiGRU untuk Klasifikasi Berita Indonesia Menggunakan Fast Text Embedding dan Confidence Based Pseudo Labeling. KETIK : Jurnal Informatika, 3(06), 275–283. https://doi.org/10.70404/ketik.v3i06.697

Issue

Section

Articles

Categories