Stratifikované vzorkování
Teď už víš, že rozložení štítků tříd ve sloupci category_desc datasetu volunteer není rovnoměrné. Pokud chceš natrénovat model pro predikci category_desc, je důležité, aby byl trénován na datech reprezentujících celý dataset. Právě k tomu slouží stratifikované vzorkování!
Toto cvičení je součástí kurzu
Preprocessing pro Machine Learning v Pythonu
Pokyny k cvičení
- Vytvoř DataFrame příznaků
Xze všech sloupců kroměcategory_desc. - Vytvoř DataFrame štítků
yze sloupcecategory_desc. - Rozděl
Xayna trénovací a testovací sadu tak, aby bylo rozložení tříd ve štítcích v obou sadách stejné. - Vypiš štítky a jejich počty z
y_trainpomocí.value_counts().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a DataFrame with all columns except category_desc
X = volunteer.____(____, axis=____)
# Create a category_desc labels dataset
y = ____[[____]]
# Use stratified sampling to split up the dataset according to the y dataset
X_train, X_test, y_train, y_test = ____(____, ____, ____, random_state=42)
# Print the category_desc counts from y_train
print(____[____].____)