Začněte nyníZačněte zdarma

Použití SMOTE

V tomto cvičení znovu vyvážíme data pomocí techniky Synthetic Minority Over-sampling Technique (SMOTE). Na rozdíl od ROS SMOTE nevytváří přesné kopie existujících pozorování, ale generuje nové, syntetické vzorky, které jsou velmi podobné stávajícím pozorováním z menšinové třídy. SMOTE je tedy o něco sofistikovanější než pouhé kopírování – pojďme ho aplikovat na naše data z kreditních karet. Dataset df je k dispozici a potřebné balíčky pro SMOTE jsou již naimportovány. V následujícím cvičení si výsledek vizualizuješ a porovnáš ho s původními daty, takže efekt použití SMOTE uvidíš velmi zřetelně.

Toto cvičení je součástí kurzu

Detekce podvodů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Použij funkci prep_data na df a vytvoř příznaky X a štítky y.
  • Definuj metodu převzorkování jako standardní SMOTE a ulož ji do proměnné method.
  • Použij .fit_resample() na původní X a y, abys získal/a nově převzorkovaná data.
  • Vykresli převzorkovaná data pomocí funkce plot_data().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from imblearn.over_sampling import SMOTE

# Run the prep_data function
X, y = ____(df)

# Define the resampling method
method = ____()

# Create the resampled feature set
X_resampled, y_resampled = method.____(____, ____)

# Plot the resampled data
plot_data(____, ____)
Upravit a spustit kód