Začněte nyníZačněte zdarma

Tvůj první pipeline – znovu!

Ve startupu zaměřeném na arytmie se blíží tvoje měsíční hodnocení – a součástí bude i code review od zkušeného Python programátora. Rozhodneš se kód uklidit: dodržíš osvědčené postupy a nahradíš skript pro výběr příznaků a klasifikaci pomocí náhodného lesa pipelinem. Pracuješ s trénovací datovou sadou dostupnou jako X_train a y_train a s několika moduly: RandomForestClassifier, SelectKBest() a f_classif() pro výběr příznaků, dále GridSearchCV a Pipeline.

Toto cvičení je součástí kurzu

Designing Machine Learning Workflows in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř pipeline se selektorem příznaků zadaným v ukázkovém kódu a klasifikátorem náhodného lesa. Pojmenuj první krok feature_selection.
  • Do params přidej dva páry klíč–hodnota: jeden pro počet příznaků k v selektoru s hodnotami 10 a 20, a druhý pro n_estimators v lese s možnými hodnotami 2 a 5.
  • Inicializuj objekt GridSearchCV s daným pipelinem a mřížkou parametrů.
  • Natrénuj objekt na datech a vypiš nejlepší kombinaci parametrů.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create pipeline with feature selector and classifier
pipe = ___([
    (___, SelectKBest(f_classif)),
    ('clf', ___(random_state=2))])

# Create a parameter grid
params = {
   'feature_selection__k':___,
    ___:[2, 5]}

# Initialize the grid search object
grid_search = ___(___, ___=params)

# Fit it to the data and print the best value combination
print(grid_search.fit(___, ___).___)
Upravit a spustit kód