Text
KLASIFIKASI EMAIL SPAM DAN NON-SPAM MENGGUNAKAN METODE MULTINOMIAL NAÏVE BAYES BERBASIS FITUR HIBRIDA (STRUKTURAL DAN TEKSTUAL) UNTUK OPTIMALISASI AKURASI FILTERISASI
Email merupakan salah satu media komunikasi digital yang banyak digunakan, namun juga rentan terhadap penyebaran pesan spam yang dapat mengganggu pengguna dan berpotensi menimbulkan kerugian. Penelitian ini bertujuan membangun model klasifikasi email spam menggunakan algoritma Multinomial Naïve Bayes dengan pendekatan hybrid feature yang menggabungkan fitur tekstual TF-IDF dan fitur struktural email. Dataset yang digunakan merupakan hasil penggabungan Enron Spam Dataset dan SpamAssassin Dataset dengan total 11.368 data, kemudian setelah proses preprocessing diperoleh 11.330 data yang siap digunakan. Penelitian menerapkan tahapan text preprocessing, ekstraksi fitur struktural, transformasi logaritmik, normalisasi menggunakan MinMaxScaler, serta pembobotan fitur struktural melalui Stratified 5-Fold Cross Validation. Pengujian dilakukan pada tiga skenario pembagian data, yaitu 70:30, 75:25, dan 80:20. Hasil penelitian menunjukkan bahwa model hybrid Multinomial Naïve Bayes mampu memberikan performa yang lebih baik dibandingkan model baseline berbasis TF-IDF saja. Performa terbaik diperoleh pada skenario pembagian data 80:20 dengan bobot fitur struktural sebesar 5, menghasilkan nilai accuracy sebesar 97,57%, precision sebesar 97,40%, recall sebesar 92,06%, dan F1-score sebesar 94,66%. Hasil tersebut menunjukkan bahwa penggabungan fitur tekstual dan fitur struktural efektif dalam meningkatkan kemampuan deteksi email spam sehingga dapat digunakan sebagai solusi klasifikasi email spam secara otomatis
No other version available