Použití SMOTE
V tomto cvičení znovu vyvážíme data pomocí techniky Synthetic Minority Over-sampling Technique (SMOTE). Na rozdíl od ROS SMOTE nevytváří přesné kopie existujících pozorování, ale generuje nové, syntetické vzorky, které jsou velmi podobné stávajícím pozorováním z menšinové třídy. SMOTE je tedy o něco sofistikovanější než pouhé kopírování – pojďme ho aplikovat na naše data z kreditních karet.
Dataset df je k dispozici a potřebné balíčky pro SMOTE jsou již naimportovány. V následujícím cvičení si výsledek vizualizuješ a porovnáš ho s původními daty, takže efekt použití SMOTE uvidíš velmi zřetelně.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Použij funkci
prep_datanadfa vytvoř příznakyXa štítkyy. - Definuj metodu převzorkování jako standardní SMOTE a ulož ji do proměnné
method. - Použij
.fit_resample()na původníXay, abys získal/a nově převzorkovaná data. - Vykresli převzorkovaná data pomocí funkce
plot_data().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from imblearn.over_sampling import SMOTE
# Run the prep_data function
X, y = ____(df)
# Define the resampling method
method = ____()
# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)
# Plot the resampled data
plot_data(____, ____)