Studi Kasus: Isu Sosial-Politik & Budaya di Platform Twitter
Repositori ini merupakan implementasi penelitian tentang pengaruh emotikon (😡, 🎉) dan bahasa informal (slang) terhadap akurasi klasifikasi sentimen tweet berbahasa Indonesia. Fokus utama proyek ini adalah:
- Membangun pipeline pemrosesan teks khusus untuk bahasa informal Indonesia.
- Menganalisis dampak emotikon dan slang pada model machine learning dan deep learning.
- Menyediakan dataset berlabel dan kamus slang Indonesia yang siap digunakan untuk penelitian NLP lanjutan.
Contoh Kasus:
- 🚨 "Gempa lagi, pemerintah tidur ya? 😡 #Gempa" (Sentimen: Negatif)
- ❤️ "Layanan ojek online mantul bangeet! 👍 #Bucin" (Sentimen: Positif)
- 🛠️ Preprocessing Khusus Bahasa Indonesia
- Konversi emotikon → teks (😡 →
[marah]). - Translasi slang ("wkwk" →
tertawa, "bucin" →budak cinta).
- Konversi emotikon → teks (😡 →
- 🤖 Model Hybrid
- Kombinasi lexicon-based (VaderSentiment) dan deep learning (LSTM + FastText).
- 📊 Analisis Komparatif
- Perbandingan akurasi model dengan/tanpa fitur emotikon & slang.
sentimen-analisis-indonesia/
├── data/ # Dataset
│ ├── raw/ # Data mentah (CSV dari Twitter)
│ ├── processed/ # Data hasil preprocessing
│ └── labeled/ # Data berlabel manual
│
├── notebooks/ # Eksperimen Jupyter Notebook
│ ├── 1_data_collection.ipynb
│ ├── 2_preprocessing.ipynb
│ └── 3_model_training.ipynb
│
├── src/ # Kode inti
│ ├── crawler.py # Script crawling Twitter
│ ├── preprocessing.py # Konversi emotikon & slang
│ └── model.py # Arsitektur LSTM & SVM
│
├── results/ # Output analisis
│ ├── figures/ # Visualisasi (PNG/PDF)
│ └── models/ # Model terlatih (H5/PKL)
│
├── requirements.txt Dependencies
└── README.md Dokumentasi ini- Python 3.9+
- Git
git clone https://github.com/username/sentimen-analisis-indonesia.git
cd sentimen-analisis-indonesiapip install -r requirements.txt- Crawling Data (Contoh:
#Bucin):python src/crawler.py --query "#Bucin" --limit 1000
- Preprocessing:
python src/preprocessing.py --input data/raw/bucin.csv
- Training Model:
python src/model.py --data data/processed/cleaned_data.csv
| Model | Akurasi (Tanpa Emotikon) | Akurasi (Dengan Emotikon) |
|---|---|---|
| SVM | 00% | 00% (+00%) |
| LSTM | 00% | 00% (+00%) |
- Emotikon Paling Signifikan: ❤️ (Positif), 😡 (Negatif)
- Slang Paling Umum: "mantul", "bucin", "geming"

Distribusi Emotikon dalam Dataset #Bucin
Kami terbuka untuk kontribusi! Berikut cara ikut serta:
- Tambahkan Slang Baru:
Editdata/processed/slang_dictionary.jsondan buka Pull Request. - Laporkan Issue:
Temukan bug? Buka Issues.
Panduan Kontribusi:
- Ikuti standar PEP8 untuk kode Python.
- Dokumentasikan perubahan di
CHANGELOG.md.
Proyek ini dilisensikan di bawah MIT License. Lihat LICENSE untuk detail.
- Dosen Pembimbing: Prof. Dr. Budi Santoso, M.Kom.
- Dataset: Kaggle Indonesian Slang Words
- Tools:
emoji,nltk,tweepy
✨ Let's Revolutionize Indonesian NLP Together!
"Dari tweet untuk Indonesia yang lebih memahami emosi digital warganya."