Algoritma Analisis Sentimen Twitter
Algoritma Analisis Sentimen Twitter
(Comparison of Random Forest, Naïve Bayes, and Support Vector Machine Algorithms in Twitter
Sentiment Analysis Regarding Public Opinion on the Elimination of Honorary Personnel)
Akhmad Miftahusalam1*, Adinda Febby Nuraini1, Awalia Agustina Khoirunisa1, Hasih Pratiwi1
1
Program Studi Statistika, Universitas Sebelas Maret
Jl. Ir. Sutami No.36, Kentingan, Kec. Jebres, Kota Surakarta, Jawa Tengah 57126
Email : miff28@[Link]
ABSTRAK
Pegawai merupakan aset penting dalam instansi, sebagai pihak yang merencanakan dan bertindak untuk setiap kegiatan
organisasi, termasuk di instansi pemerintah. Meskipun karyawan penting di instansi pemerintah, tidak mudah
mendapatkan pegawai karena sulitnya persetujuan dari Kementerian Pendayagunaan Aparatur Negara. Hal tersebut yang
memicu munculnya pegawai tidak tetap atau tenaga honorer. Tujuannya untuk memenuhi kebutuhan posisi yang kosong.
Namun, setelah menjabat selama puluhan tahun, pemerintah mengumumkan akan menghapus pegawai tenaga honorer.
Kabar ini tentu menimbulkan pro dan kontra di masyarakat. Untuk melihat pendapat masyarakat tentang masalah ini,
platform Twitter dapat digunakan sebagai sumber data. Banyak pengguna yang aktif menulis informasi dalam bentuk
tweet terkait penghapusan tenaga honorer. Tweet tersebut dianalisis menggunakan algoritma Random Forest, Naive
Bayes, dan Support Vector Machine (SVM). Diperoleh metode terbaik pada algoritma Random Forest dengan
penanganan data imbalanced menggunakan random oversampling diperoleh akurasi sebesar 66,67%.
Kata kunci: Analisis Sentimen Twitter, Tenaga Honorer, Naïve Bayes, Random Forest, Support Vector Machine
ABSTRACT
Employees are an important asset in agencies, who plan and act for every activity of an organization, as well as in
government agencies. Although employees are important in government agencies, it is not easy to get employees due to
the difficulty of approval from the Ministry of State Apparatus Utilization and Bureaucratic Reform. This is what triggers
the emergence of temporary or contract workers. The goal is to meet the needs of vacant employees. However, after
serving for decades, the government announced it would eliminate the appointment of temporary employees. This news
certainly raises the pros and cons in society. To see people's opinion on this issue, the Twitter platform can be used as a
data source. Many users are actively writing information in the form of tweets related to the removal of temporary
workers. The tweets were analyzed using Random Forest, Naive Bayes, and Support Vector Machine (SVM). The best
method is Random Forest with random oversampling to handle imbalanced data, this method can obtain an accuracy of
66.67%.
Keywords: Sentiment Analysis Twitter, Honorary Workers, Naïve Bayes, Random Forest, Support Vector Machine
PENDAHULUAN
Perkembangan teknologi yang disebabkan era globalisasi memberikan dampak positif dan negatif dalam
kehidupan masyarakat. Pesatnya perkembangan teknologi membuat segala layanan informasi dapat dengan
mudah diakses dan didapatkan. Salah satu cara untuk mendapatkan informasi dapat diakses melalui media
sosial. Media sosial merupakan tempat orang-orang dari seluruh dunia untuk saling terhubung dan
menyebarkan informasi, pendapat, dan berita. Beberapa media sosial yang sering digunakan antara lain,
Facebook, YouTube, Instagram, dan Twitter.
Berdasarkan Surat Edaran Menteri Pendayagunaan Aparatur Negara dan Reformasi Birokras bernomor
B/185/[Link].02.03/2022 perihal Status Kepegawaian di Lingkungan Instansi Pemerintah Pusat dan
Pemerintah Daerah, Pemerintah berencana menghapus tenaga honorer dalam instansi pemerintah pusat dan
pemerintah daerah. Berdasarkan surat edaran tersebut terdapat tiga alasan penghapusan tenaga honorer pada
tahun 2023. Pertama pemerintah ingin memberikan kejelasan status pada tenaga honorer, kedua pemerintah
ingin memberikan gaji yang layak terhadap tenaga honorer yang telah mengabdi, yang terakhir pemerintah
563
Seminar Nasional Official Statistics 2022
ingin memberikan kesejahteraan agar mendapat kejelasan dan pendapatan yang layak. Rencana tersebut
merupakan salah satu langkah strategis untuk membangun Aparatur Sipil Negara (ASN) yang lebih profesional
dan sejahtera.
Penghapusan tenaga honorer menjadi perbincangan hangat di media sosial Twitter. Banyak orang
Indonesia yang memberikan opininya mengenai hal tersebut. Dalam jangka waktu delapan hari, hasil crawling
Twitter menunjukkan terdapat sebanyak 1147 tweet yang dibuat oleh masyarakat Indonesia mengenai
penghapusan tenaga honorer. Banyaknya opini publik yang beredar di media sosial Twitter dapat dilakukan
analisa untuk melihat kecenderungan opini yang dibagikan (Kumar A. & Sebastian T., 2012).
Analisis sentimen adalah metode melakukan proses klasifikasi dokumen teks berdasarkan pendapat dan
pandangan masyarakat tertentu dengan memahami, mengolah, dan mengekstraksi data yang berupa dokumen
teks. Bertujuan untuk menentukan apakah pendapat atau reaksi tersebut bersifat positif, bersifat negatif,
maupun bersifat normal atau seperti tidak terjadi apa-apa yang biasa disebut dengan netral terhadap fenomena
atau peristiwa yang sedang diselidiki (Ratino, dkk., 2019). Analisis sentimen merupakan salah satu penerapan
machine learning (Pane & Ramdan, 2022). Salah satu masalah yang ditemui dalam penggunaan machine
learning yaitu ketidakseimbangan kelas. Ketidakseimbangan kelas terjadi ketika kelas minoritas lebih kecil
daripada kelas mayoritas (Ren, dkk., 2017).
Teknik resampling merupakan salah satu tahapan dalam preprocessing dimana distribusi data
diseimbangkan kembali untuk mengurangi efek distribusi kelas tidak seimbang. Pendekatan resampling
memiliki tiga kategori yaitu, oversampling, undersampling, dan hibrida yang mengkombinasikan kedua
pendekatan sampling sebelumnya (Jian, dkk., 2016). Penelitian yang dilakukan oleh Syukron dan Subekti
(2018) menggunakan dataset German Credit dengan algoritma Random Forest memiliki akurasi sebesar 76%.
Sedangkan dengan menerapkan metode oversampling pada algoritma Random Forest dapat meningkatkan
akurasi sebesar 4,8% dengan nilai akurasi 80,8%.
Beberapa penelitian sebelumnya mengenai analisis sentimen adalah penelitian yang dilakukan oleh
Neogi, dkk (2021) mengenai analisis sentimen dan klasifikasi pada kasus protes petani India menggunakan
algoritma Naïve Bayes, Decision Tree, Random Forest, dan Support Vector Classification (SVC). Penelitian
ini memiliki tingkat akurasi sebesar 96,6% pada algoritma Random Forest. Penelitian lain yang dilakukan oleh
Fitri, dkk (2019) tentang sentimen analisis di media sosial mengenai kampanye anti LGBT menghasilkan
tingkat akurasi pada algoritma Naïve Bayes sebesar 83,43% lebih tinggi daripada algoritma Decision Tree dan
Random Forest. Selanjutnya terdapat penelitian oleh Watmah, dkk (2021) mengenai analisis sentimen pada e-
commerce Shopee menggunakan algoritma KNN, Support Vector Machine (SVM), dan Random Forest. Pada
penelitian tersebut diperoleh nilai akurasi tertinggi pada algoritma SVM yaitu sebesar 89,4%.
Pada penelitian-penelitian terdahulu, dari beberapa analisis sentimen mengenai penerapan kebijakan
pemerintah, kegiatan protes, ataupun kampanye, diperoleh algoritma terbaik yang berbeda. Sehingga
berdasarkan latar belakang di atas, penelitian ini akan membandingkan tiga algoritma yaitu Random Forest,
Naive Bayes, dan SVM untuk menganalisis sentimen mengenai penghapusan tenaga honorer. Penelitian ini
bertujuan untuk mengklasifikasikan opini yang beredar di masyarakat berupa opini positif, negatif, ataupun
netral melalui media sosial Twitter.
METODE
Crawling Data
Suatu program yang dirancang secara khusus untuk mengumpulkan semua data atau informasi yang
dibutuhkan dalam suatu web disebut aplikasi data retrieval atau web spider (Suharno & Listiyoko, 2018).
Crawling data di Twitter adalah suatu proses untuk mengambil data dengan bantuan Application Programming
Integration (API) Twitter baik berupa data user maupun data tweet (Sembodo, dkk., 2016). Cara melakukan
crawling data adalah dengan membuat program dan memasukkan kata kunci yang ingin dicari.
Analisis Sentimen
Analisis sentimen merupakan pengolahan untuk melihat suasana hati masyarakat terhadap suatu produk
atau topik tertentu (Pintoko & Kemas, 2018). Analisis sentimen digunakan untuk menentukan apakah sebuah
nilai berupa positif maupun negatif, di mana nilai tersebut digunakan sebagai parameter mengambil suatu
keputusan. Banyak metode dalam menganalisis sentimen, misalnya Random Forest, Naïve Bayes, dan Support
Vector Machine (SVM).
Preprocessing Data
564
Perbandingan Algoritma Pada Analisis Sentimen Twitter ………………………………….(Nuraini, Miftahusalam, Khoirunisa, Pratiwi)
Preprocessing adalah proses mempersiapkan data atau tweet ke dalam bentuk “bag-of-words” guna
mengurangi dimensi data dan mempertahankan makna dari teks tersebut. Preprocessing data terdiri dari
tokenization, case folding, cleansing, stopwords removal, stemming, dan filtering (Amalia, dkk., 2018).
Tokenization merupakan proses pembagian kalimat menjadi beberapa bagian yang disebut token. Case folding
adalah proses mengubah semua huruf menjadi bentuk yang sama, misal huruf kecil. Cleansing merupakan
proses menghilangkan noise seperti tanda baca, hashtag, username, alamat URL, dan emotikon. Stopwords
removal untuk menghapus kata-kata yang tidak penting. Stemming berupa proses mendapatkan kata dasar
dengan menghilangkan imbuhan. Sedangkan filtering adalah proses pemilihan tweet dengan kata-kata Bahasa
Indonesia yang tidak baku dan kemudian diganti dengan sinonim (kata baku) atau menambahkan kata tidak
baku tersebut guna mengoptimalkan perhitungan frekuensi kemunculan kata yang memiliki makna sama.
Feature extraction
Feature extraction digunakan untuk mengurangi dimensi data sehingga diperoleh kata-kata yang relevan
atau dapat menggambarkan data, walaupun sebelumnya telah dilakukan stopword atau penghapusan kata yang
bukan deskriptif (Praptiwi, 2018). Sehingga perlu melakukan feature extraction untuk mengetahui seberapa
penting sebuah kata mewakili sebuah dokumen atau kalimat.
Balancing Data
Klasifikasi merupakan pemodelan yang memasukkan suatu data ke dalam suatu kelas. Jumlah data yang
masuk dalam tiap kelas merupakan kelas distribusi. Dalam pendistribusian data terkadang terdapat perbedaan
jumlah anggota kelas yang biasanya disebut imbalanced data. Misalkan dalam suatu klasifikasi dengan dua
kelas, rasio antar kelasnya adalah 1:3. Kebanyakan imbalanced data memiliki rasio perbedaan antar kelasnya
sebesar 1:4 hingga 1:100 untuk tiap labelnya, namun terkadang mampu mencapai rasio 1:5000 (Krawczyk,
2016). Walaupun begitu dataset apapun dengan kelas distribusi yang berbeda secara teknis dikatakan
imbalanced (Brownlee, 2019)
Teknik Sampling
Dalam mengatasi ketidakseimbangan kelas (imbalanced data) dapat menerapkan teknik sampling seperti
undersampling dan oversampling. Undersampling akan menyeimbangkan data dengan mengurangi ukuran
kelas yang mayoritas dengan menjaga semua sampel di kelas minoritas dan secara acak memilih jumlah sampel
yang sama di kelas mayoritas. Sedangkan oversampling akan menambahkan jumlah data di kelas minoritas
sehingga memiliki kelas yang sama atau mendekati dengan kelas mayoritas dengan cara menduplikat sampel
secara random dari kelas minoritas hingga rasio kelas yang diinginkan terpenuhi (Ustyannie & Suprapto,
2020).
Naive Bayes
Algoritma naive bayes merupakan metode untuk menggolongkan data yang didasarkan dari probabilitas
sederhana dimana digunakan dengan asumsi kelas satu tidak bergantung dengan kelas yang lainnya (Riyan,
dkk., 2014). Klasifikasi naive bayes menekankan estimasi probabilitas. Pendekatan ini memberikan
keuntungan dimana klasifikasi menghasilkan nilai error yang lebih kecil dibandingkan set berjumlah besar.
Random Forest
Algoritma Random Forest merupakan pengembangan metode CART dimana menerapkan penggunaan
metode bootstrap aggregating (bagging) dan random feature selection (Breiman, 2001). Banyak pohon yang
ditumbuhkan pada Random Forest hingga mampu membentuk hutan (forest), dimana kumpulan pohon ini
nantinya akan dianalisis.
Algoritma Support Vector Machine (SVM) merupakan metode supervised yang biasa digunakan untuk
klasifikasi data menjadi suatu kelas tertentu. SVM bekerja dengan memetakan data training yang telah berlabel
menjadi titik ruang, dimana titik tersebut dipetakan hingga jarak titik terdekat antar kelas data training menjadi
jauh (Lingga, dkk., 2017). Dalam menerapkan model SVM ini membutuhkan suatu parameter. Di mana
565
Seminar Nasional Official Statistics 2022
keakuratan model sangat bergantung pada parameter tersebut, dan karenanya nilai optimal akan
didapat dari teknik grid-search yang sesuai (Nayak & Natarajan, 2016).
Evaluasi Model
Pada tahap evaluasi model, untuk mengetahui kebaikan model suatu algoritma dilakukan evaluasi
menggunakan nilai akurasi. Confusion matrix pada Tabel 1 digunakan untuk mengevaluasi kinerja
pengklasifikasi.
Tabel 1. Evaluasi Model Klasifikasi
Positif (prediksi) Negatif (prediksi)
Positif (aktual) True Positif (TP) False Negatif (FN)
Negatif (aktual) False Positif (FP) True Negatif (TN)
True positive merupakan data dengan label positif dan diprediksi positif, sedangkan apabila data tersebut
diprediksi negatif maka tergolong false negative. Sebaliknya, true negative merupakan data dengan label
negatif dan diprediksi negatif, sedangkan jika data tersebut diprediksi positif maka tergolong false positive
(Fawcett, 2006). Akurasi, precision, recall, dan F1-score dapat dihitung melalui persamaan-persamaan
berikut:
𝑇𝑃+𝑇𝑁
𝐴𝑘𝑢𝑟𝑎𝑠𝑖 = 𝑇𝑃+𝐹𝑁+𝐹𝑃+𝑇𝑁 ................................................................................................................. (1)
𝑇𝑃
𝑃𝑟𝑒𝑐𝑖𝑠𝑖𝑜𝑛 = 𝑇𝑃+𝐹𝑃
………………………………………………………….……..……..……….. (2)
𝑇𝑃
𝑅𝑒𝑐𝑎𝑙𝑙 = 𝑇𝑃+𝐹𝑁………………………………………………………………….………...……… (3)
𝑅𝑒𝑐𝑎𝑙𝑙∗𝑃𝑟𝑒𝑠𝑖𝑠𝑖
𝐹1 − 𝑠𝑐𝑜𝑟𝑒 = 2 ∗ 𝑅𝑒𝑐𝑎𝑙𝑙+𝑃𝑟𝑒𝑠𝑖𝑠𝑖 ……………………………………………………..….…..……… (4)
Data yang digunakan merupakan data ulasan pada Twitter mengenai tenaga honorer. Pengumpulan data
menggunakan teknik crawling melalui Twitter API dengan memanfaatkan paket tweepy dengan periode data
dari tanggal 31 Mei 2022 hingga 8 Juni 2022.
Langkah-Langkah Penelitian
Tahapan analisis yang dilakukan dalam penelitian menggunakan bantuan bahasa pemrograman Python
dengan langkah-langkah seperti berikut:
A. Pengumpulan dan Pelabelan Data
Pengumpulan data melalui Twitter API berdasarkan periode waktu dengan kata kunci yaitu tenaga
honorer. Data tweet yang terkumpul dilabeli secara manual oleh tiga anatator dengan penentuan label
final menggunakan modus. Pelabelan data dibagi menjadi tiga kelas yaitu sentimen negatif, netral, dan
positif. Pelabelan sentimen negatif berdasarkan tweet-tweet yang kontra dengan penghapusan tenaga
honorer, pelabelan sentimen netral berdasarkan tweet-tweet yang berisi kalimat pro dan kontra sekaligus
terhadap penghapusan tenaga honorer, sedangkan pelabelan sentimen positif berdasarkan tweet-tweet
yang pro atau mendukung penghapusan tenaga honorer.
B. Preprocessing Data
Preprocessing data teks terdiri dari menghapus kolom yang tidak digunakan, menghapus data duplikat,
membersihkan ulasan, melakukan case folding, stopwords removal,stemming, tokenization, dan
melakukan feature extraction dengan Bag of Words (Bow) dan pembobotan menggunakan TF-IDF.
Kemudian membagi data menjadi data training dan data testing dengan perbandingan masing-masing
80:20.
C. Balancing Data
Dalam mengatasi data yang tidak seimbang (imbalance data) dapat menggunakan teknik sampling yaitu
random undersampling dan random oversampling. Kedua teknik sampling tersebut digunakan untuk
membandingkan teknik mana yang memiliki pengaruh lebih terhadap nilai evaluasi eror.
D. Pemodelan dan Evaluasi
Pemodelan menggunakan metode klasifikasi yaitu Naive Bayes, Random Forest, dan Support Vector
Machine dengan menerapkan teknik sampling yaitu random undersampling dan random oversampling
pada masing-masing metode. Dalam mengevaluasi model menggunakan nilai akurasi dan F1-score.
Model terbaik dipilih berdasarkan nilai akurasi dan F1-score tertinggi.
566
Perbandingan Algoritma Pada Analisis Sentimen Twitter ………………………………….(Nuraini, Miftahusalam, Khoirunisa, Pratiwi)
Karakteristik Data
Ulasan mengenai penghapusan tenaga honorer diklasifikasi ke dalam label negatif, netral, atau positif.
Dengan bantuan API Twitter didapatkan keseluruhan tweet mengenai tenaga honorer sebanyak 2690 data.
Setelah melalui crawling data dan preprocessing data diperoleh 1147 ulasan. Ulasan tersebut dilakukan
pelabelan dengan jumlah ulasan pada setiap kategori ditunjukkan pada Tabel 2.
Tabel 2. Tabel Kategori Ulasan
Kategori Ulasan Jumlah
0 – Negatif 390
1 – Netral 335
2 – Positif 422
Total 1147
Untuk contoh tweet untuk tiap labelnya dapat dilihat pada Tabel 3.
Tabel 3. Contoh Tweet Tiap Label
No. Ulasan Label
1. @DrEvaChaniago Semoga pemerintah jgn secepat itu utk menghapus tenaga honorer sekaligus Negatif
melainkan secara demi tahap menyelesaikan agar tdk berdampak pada tingkat pengangguran
setinggi2nya
2. udh terlalu bnyk denger kasus katanya tenaga honorer itu dimasukin oleh pihak pejabat semacam dekeng Netral
gtu, ya mungkin keputusan pemerintah untuk menghapus tenaga honorer juga "mungkin benar" namun
juga akan menimbulkan konsekuensi berat lainnya, semisal: angka pengangguran
3. @aufalkausar27 @direktoridosen lho justru sy guru honorer jg. bukan pegawai kemen kemen. cm sy Positif
realistis aja, bertahun2 drdl guru jg udah pada demo gaji layak, ga pernah dikabulkan. skrg mlh
rencananya tenaga honorer thn depan dihapus. sy lebih setuju dihapus skalian drpd gajinya sgt tidak
manusiawi/bebannya.
Pada Tabel 3 dapat dilihat bahwa pada contoh tweet netral terdapat ekspresi kalimat pro dan kontra terhadap
penghapusan tenaga honorer. Kalimat pro ditunjukkan pada kegiatan mendukung penghapusan tenaga honorer
yang dianggap merupakan keputusan yang benar yang telah diambil pemerintah, sedangkan di kalimat tersebut
juga terdapat kalimat kontra yang menjelaskan adanya penghapusan tenaga honorer dapat menimbulkan
konsekuensi yang berat seperti bertambahnya angka pengangguran. Pelabelan tiap tweet bersifat subjektif,
karenanya pelabelan tiap individu dapat berbeda.
Preprocessing Data
Preprocessing pada data bertujuan untuk menghilangkan noise, memperjelas fitur, meningkatkan akurasi,
dan mengkonversi data asli sehingga dapat diolah sesuai dengan kebutuhan penelitian. Yang pertama
menghapus kolom yang tidak digunakan, sehingga tersisa kolom tweet dan label. Selanjutnya dilakukan
penghapusan tweet duplikat serta kata dalam tweet yang tidak digunakan juga dihilangkan. Untuk lebih
jelasnya salah satu contoh preprocessing tweet dapat dilihat pada Tabel 4.
Tabel 4. Hasil Preprocessing Tweet
Tahapan Hasil Preprocessing
Ulasan Asli @DrEvaChaniago Semoga pemerintah jgn secepat itu utk menghapus tenaga
honorer sekaligus melainkan secara demi tahap menyelesaikan agar tdk
berdampak pada tingkat pengangguran setinggi2nya
Hapus tautan HTML, ikon emoji, Semoga pemerintah jgn secepat itu utk menghapus tenaga honorer sekaligus
sebutan, nama pengguna, tagar, angka, melainkan secara demi tahap menyelesaikan agar tdk berdampak pada
tanda baca, dan strip ruang putih tingkat pengangguran setingginya
567
Seminar Nasional Official Statistics 2022
Setelah menghapus data duplikat diperoleh sebanyak 1034 ulasan dimana 372 ulasan berupa sentimen
negatif, 288 ulasan berupa sentimen netral, dan 374 ulasan berupa sentimen positif terkait ulasan mengenai
penghapusan tenaga honorer yang dapat dilihat pada Gambar 1.
Perbedaan jumlah anggota tiap kelas tentu akan mempengaruhi hasil keakuratan model. Berdasarkan
Gambar 1 dan Tabel 7 terlihat perbedaan jumlah anggota pada kelas negatif, netral, dan positif. Sehingga pada
penelitian ini menggunakan teknik random oversampling dan random undersampling untuk mengatasi data
imbalanced tersebut. Teknik random oversampling digunakan untuk membuat sintesis atau duplikat dari kelas
minoritas dengan cara merandom data yang ada. Pada kelas netral dan positif disintesis sehingga diperoleh
jumlah anggota sama dengan kelas negatif yaitu 374 ulasan tiap kelasnya. Sedangkan, teknik random
undersampling digunakan untuk mengurangi kelas mayoritas secara random, sehingga pada kelas negatif dan
netral diperoleh jumlah anggota yang sama dengan kelas positif yaitu 288 ulasan tiap kelasnya. Hasil balancing
data menggunakan random oversampling dan random undersampling seperti pada Tabel 5.
Tabel 5. Hasil Balancing Data
Label Random Oversampling Random Undersampling
0 - Negatif 374 374 288
1 - Netral 372 374 288
2 - Positif 288 374 288
Setelah melalui beberapa tahap, data kemudian siap digunakan untuk analisis. Dalam penelitian kali ini
digunakan sebanyak tiga metode yaitu Random Forest, SVM, dan Naïve Bayes. Sebanyak 80% data digunakan
sebagai data training sedangkan sisanya 20% data digunakan sebagai data testing. Ketiga model tersebut
menghasilkan nilai keakuratan yang dapat dilihat pada Tabel 6.
568
Perbandingan Algoritma Pada Analisis Sentimen Twitter ………………………………….(Nuraini, Miftahusalam, Khoirunisa, Pratiwi)
Tabel 6 menunjukkan bahwa nilai akurasi tertinggi terdapat pada metode Random Forest dengan
penanganan data imbalanced menggunakan random oversampling yaitu sebesar 0,666666 atau 66,67%. Nilai
akurasi tersebut masih tergolong rendah, sehingga perlu melihat perbandingan nilai evaluasi lainnya seperti
precision, recall, atau F1-Score. Dalam penelitian ini, selain menggunakan nilai akurasi sebagai evaluasi eror,
juga menggunakan nilai F1-Score. F1-Score digunakan untuk pembanding antar metode karena false positif,
netral, dan negatif dalam sentimen tenaga honorer terlihat memiliki pengaruh pada data. Selain itu, nilai
precision dan recall tidak digunakan untuk menentukan model terbaik karena nilai F1-Score sudah mewakili
kedua nilai tersebut dalam perhitungannya.
Tabel 7. Nilai F1-Score
F1-Score F1-Score Weighted
Metode
Average
Negatif Netral Positif
Berdasarkan Tabel 7 diperoleh bahwa nilai F1-Score Weighted Average tertinggi pada metode Random
Forest dengan teknik sampling random oversampling yaitu sebesar 0,67 atau 67%. Hal ini sesuai dengan
model terbaik yang ditentukan berdasarkan nilai akurasi tertinggi. Sehingga dapat disimpulkan bahwa model
terbaik untuk analisis sentimen Twitter mengenai isu tenaga honorer adalah metode Random Forest dengan
penanganan data imbalanced menggunakan random oversampling ditunjukkan dengan nilai akurasi dan F1-
Score tertinggi diantara metode lainnya.
Model Terbaik
Dengan model terbaik maka akan didapatkan prediksi analisis sentimen Twitter mengenai isu tenaga
honorer dimana didapatkan confusion matrix prediksi model seperti pada Tabel 8.
Tabel 8. Confusion Matrix
Prediksi
Negatif Netral Positif
Negatif 46 8 4
Aktual Netral 24 57 9
Positif 8 22 47
569
Seminar Nasional Official Statistics 2022
Berdasarkan Tabel 8 dapat diketahui bahwa model Random Forest mengklasifikasikan dengan tepat
ulasan negatif sebanyak 46 ulasan, ulasan netral sebanyak 57 ulasan, dan ulasan positif sebesar 47 ulasan.
Visualisasi dengan word cloud untuk masing-masing sentimen pada data tweet mengenai isu tenaga
honorer adalah sebagai berikut.
Pada sentimen negatif di Gambar 2, netral di Gambar 3, dan positif di Gambar 4, kata kunci terbanyak
yang digunakan adalah kata ‘tenaga’ dan ‘honorer’. Hasil tersebut disebabkan karena adanya keseimbangan
opini para pengguna Twitter mengenai isu ini yang didukung dengan hasil dari Tabel 8. Pada Tabel 8 hasil
pengklasifikasian antara tiap sentimen tidak terlalu jauh.
KESIMPULAN
Berdasarkan hasil analisis sentimen Twitter mengenai opini masyarakat terhadap penghapusan tenaga
honorer didapatkan bahwa klasifikasi menggunakan metode Random Forest dengan penanganan data
imbalanced menggunakan random oversampling menghasilkan tingkat akurasi lebih tinggi yaitu sebesar
66,67% daripada menggunakan metode SVM dan Naïve Bayes. Sehingga model tersebut dapat digunakan
pemerintah untuk mengklasifikasi sentimen masyarakat terhadap penetapan kebijakan penghapusan tenaga
honorer selanjutnya.
Pada penelitian ini diperoleh bahwa sentimen masyarakat mengenai kebijakan pemerintah dalam
menghapus tenaga honorer pada tahun 2023 mendapat keseimbangan opini baik negatif, netral, ataupun positif.
Sehingga pemerintah diharapkan untuk lebih mempertimbangkan kebijakan yang akan diambil selanjutnya
mengenai tindak lanjut penghapusan tenaga honorer. Untuk penelitian selanjutnya, perlu dicoba
mengembangkan dengan metode lain atau algoritma yang dimodifikasi dengan data yang lebih banyak dan
real time untuk mendapatkan hasil akurasi yang lebih baik.
570
Perbandingan Algoritma Pada Analisis Sentimen Twitter ………………………………….(Nuraini, Miftahusalam, Khoirunisa, Pratiwi)
DAFTAR PUSTAKA
Amalia,A., Oktinas,W., Aulia,I., & Rahmat, R. F. (2018). “Determination of quality television programmes
based on sentiment analysis on Twitter,” Journal of Physics: Conference Series, 978-012117, doi:
10.1088/1742- 6596/978/1/012117.
Andrian,M. R., Putra, M. P., Rafialdy, M. H., & Rakhmawati, N, A. (2021). “Perbandingan Metode
Klasifikasi Random Forest dan SVM Pada Analisis Sentimen PSBB,” Jurnal Informatika UPGRIS, vol.
7, no. 1, pp. 36-40.
Breiman, L. (2001). “Random Forests”. Machine Learning, vol. 45, no. 1, pp.5-
32, doi:1023/A:1010933404324.
Brownlee, J. (2019). A Gentle Introduction to Imbalanced Classification. Diakses pada 14 Agustus 2022,
[Link]
Fawcett, T. (2006). “An introduction to ROC analysis,” Pattern recognition letters, vol. 27, no. 8, pp. 861-874.
Fitri, V. A., Andreswari, R. & Hasibuan, M. A. (2019). “Sentiment Analysis of Social Media Twitter with
Case of Anti-LGBT Campaign in Indonesia using Naïve Bayes, Decision Tree, and Random Forest
Algorithm,” Procedia Computer Science, vol. 161, pp. 765-772.
Jian, C., Gao, J., & Ao, Y. (2016). A new sampling method for classifying imbalanced data based on support
vector machine ensemble. Neurocomputing, 193, 115–122. [Link]
6.02.006
Kumar, A. and Sebastian, T. (2012). Sentiment Analysis on Twitter. International Journal of Computer
Science, 9(4), pp. 1694-0814.
Krawczyk, B. (2016). “Learning from imbalanced data: open challenges and future directions”. Prog Artif
Intell 5, 221–232. [Link]
Lingga, R. D., Fatichah, C., & Purwitasari, D. (2017). “Deteksi Gempa Berdasarkan Data Twitter
Menggunakan Decision Tree, Random Forest, dan SVM,” Jurnal Teknik ITS, vol. 6, no. 1, 2017, pp. 153-
158.
[Link]. (2022). Surat Menteri PANRB Perihal Status Kepegawaian di Lingkungan Instansi Pemerintah
Pusat dan Pemerintah Daerah. Diakses pada 20 Juni 2022, [Link]
terkini/info-terkini/surat-menteri-panrb-perihal-status-kepegawaian-di-lingkungan-instansi-pemerintah-
pusat-dan-pemerintah-daerah-jakarta-31-mei-2022
Nayak, A. (2016). “Comparative study of Naïve Bayes , Support Vector Machine and Random Forest
Classifiers in Sentiment Analysis of Twitter feeds,” International Journal of Advanced Studies in
Computer Science and Engineering, vol. 5, no. 1, pp. 14–17.
Neogi, A. S., Garg, K. A., Mishra, R. K., & Dwivedi, Y. K. (2021 ). “Sentiment Analysis and Classification
of Indian Farmers' Protest using Twitter Data,” International Journal of Information Management Data
Insights, vol. 1, no. 2.
Pane, S. F., & Ramdan, J. (2022). Pemodelan Machine Learning: Analisis Sentimen Masyarakat Terhadap
Kebijakan PPKM Menggunakan Data Twitter. Jurnal Sistem Cerdas, vol. 5, no. 1, pp. 12-20.
Pintoko, B. M., Kemas, M. L. (2018). “Analisis Sentimen Jasa Transportasi Online pada Twitter Menggunakan
Metode Naïve Bayes Classifier,” E-Proceeding of Engineering, vol. 5, no.3, pp. 8121-8130.
Praptiwi, D. Y. (2018). “Analisis Sentimen Online Review Pengguna E-commerce Menggunakan Metode
Support Vector Machine dan Maximum Entropy,” Universitas Islam Indonesia.
Ratino, N. Hafidz, S. Anggraeni, & Gata,W. (2019). “Sentimen Analisis Informasi Covid-19 menggunakan
Support Vector Machine dan Naïve Bayes,” J. JUPITER, vol. 12, no. 2, pp. 1–11.
Ren, F., Cao, P., Li, W., Zhao, D., & Zaiane, O. (2017). Ensemble based adaptive over-sampling method for
imbalanced data learning in computer aided detection of microaneurysm. Computerized Medical Imaging
and Graphics, 55, 54–67. [Link] 10.1016/[Link].2016.07.01 1
Riyan, E. P., Suparti, & Rita, R. (2014). “Perbandingan Metode Klasifikasi Naïve Bayes Dan K-Nearest
Neighbor Pada Analisis Data Status Kerja Di Kabupaten Demak Tahun 2012,” Jurnal Gaussian, vol. 3,
no. 4, pp.831-838.
Sembodo, J. E., Setiawan, E. B., & Baizal, Z. K. A. (2016). “Data Crawling Otomatis pada Twitter,” Indonesia
Symposium on Computing, pp. 11-16.
Suharno, F. A. & Listiyoko, L. (2018). “Aplikasi Berbasis Web dengan Metode Crawling Sebagai Cara
Pengumpulan Data untuk Mengambil Keputusan,” Seminar Nasional Rekayasa Teknologi Informasi,
pp.105-109.
571
Seminar Nasional Official Statistics 2022
Syukron, A., & Subekti, A. (2018). Penerapan Metode Random Over-Under Sampling dan Random Forest
Untuk Klasifikasi Penilaian Kredit. Jurnal Informatika, 5(2), 175-185.
Ustyannie, W. & Suprapto. (2020). “Oversampling Method To Handling Imbalanced Datasets Problem In
Binary Logistic Regression Algorithm,” IJCCS: Indonesian Journal of Computing and Cybernetics
Systems, vol. 14, no. 1, pp. 1-10, doi: 10.22146/ijccs.37415.
Watmah, S., Suryanto, & Martias. (2021). “Komparasi Metode K-NN, Support Vector Machine, dan Random
Forest pada E-commerce Shopee,” INSANtek-Jurnal Inovasi dan Sains Teknik Elektro, vol. 2, no. 1, pp.
15-21.
572