Začněte nyníZačněte zdarma

Stratifikované vzorkování

Teď už víš, že rozložení štítků tříd ve sloupci category_desc datasetu volunteer není rovnoměrné. Pokud chceš natrénovat model pro predikci category_desc, je důležité, aby byl trénován na datech reprezentujících celý dataset. Právě k tomu slouží stratifikované vzorkování!

Toto cvičení je součástí kurzu

Preprocessing pro Machine Learning v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř DataFrame příznaků X ze všech sloupců kromě category_desc.
  • Vytvoř DataFrame štítků y ze sloupce category_desc.
  • Rozděl X a y na trénovací a testovací sadu tak, aby bylo rozložení tříd ve štítcích v obou sadách stejné.
  • Vypiš štítky a jejich počty z y_train pomocí .value_counts().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create a DataFrame with all columns except category_desc
X = volunteer.____(____, axis=____)

# Create a category_desc labels dataset
y = ____[[____]]

# Use stratified sampling to split up the dataset according to the y dataset
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)

# Print the category_desc counts from y_train
print(____[____].____)
Upravit a spustit kód