Trénování s bootstrappingem
Teď si sestavíme "slabý" klasifikátor rozhodovacího stromu a natrénujeme ho na vzorku trénovací sady vybraném s opakováním. Pomůže ti to pochopit, co se děje v každé iteraci baggingového ensemblu.
Pro výběr vzorku použiješ metodu .sample() z pandas, která má parametr replace. Například následující řádek kódu vybere vzorek s opakováním z celého DataFrame df:
df.sample(frac=1.0, replace=True, random_state=42)
Toto cvičení je součástí kurzu
Ensemble Methods in Python
Pokyny k cvičení
- Vytvoř vzorek s opakováním (
replace=True) z celé (frac=1.0) trénovací sadyX_train. - Sestav klasifikátor rozhodovacího stromu s parametrem
max_depth = 4. - Natrénuj model na vybraných trénovacích datech.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Take a sample with replacement
X_train_sample = X_train.____(____, ____, random_state=42)
y_train_sample = y_train.loc[X_train_sample.index]
# Build a "weak" Decision Tree classifier
clf = ____(____, random_state=500)
# Fit the model to the training sample
____