Kita akan membuat model klasifikasi yang mengenali jenis bunga Iris dari ukuran kelopak dan mahkotanya. Dataset Iris adalah dataset klasik yang sering dipakai untuk belajar machine learning.
Pastikan scikit-learn sudah terpasang di lingkungan Python-mu:
pip install scikit-learn
Muat dataset Iris lalu bagi menjadi data latih (80%) dan data uji (20%):
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
iris = load_iris()
X, y = iris.data, iris.target
X_latih, X_uji, y_latih, y_uji = train_test_split(
X, y, test_size=0.2, random_state=42
)
print(f"Data latih: {len(X_latih)} | Data uji: {len(X_uji)}")
Kita pakai Decision Tree, salah satu model paling mudah dipahami untuk klasifikasi:
from sklearn.tree import DecisionTreeClassifier
model = DecisionTreeClassifier()
model.fit(X_latih, y_latih) # model "belajar" dari data latih
Uji model terhadap data yang belum pernah dilihatnya, lalu hitung akurasinya:
from sklearn.metrics import accuracy_score
prediksi = model.predict(X_uji)
akurasi = accuracy_score(y_uji, prediksi)
print(f"Akurasi: {akurasi:.2f}") # biasanya > 0.90 untuk dataset Iris
Pahami alur kerja dulu (muat data → bagi → latih → evaluasi) sebelum mencoba model atau dataset yang lebih besar. Alur ini berlaku untuk hampir semua proyek machine learning.
BengkelKode