Tvůj první pipeline – znovu!
Ve startupu zaměřeném na arytmie se blíží tvoje měsíční hodnocení – a součástí bude i code review od zkušeného Python programátora. Rozhodneš se kód uklidit: dodržíš osvědčené postupy a nahradíš skript pro výběr příznaků a klasifikaci pomocí náhodného lesa pipelinem. Pracuješ s trénovací datovou sadou dostupnou jako X_train a y_train a s několika moduly: RandomForestClassifier, SelectKBest() a f_classif() pro výběr příznaků, dále GridSearchCV a Pipeline.
Toto cvičení je součástí kurzu
Designing Machine Learning Workflows in Python
Pokyny k cvičení
- Vytvoř pipeline se selektorem příznaků zadaným v ukázkovém kódu a klasifikátorem náhodného lesa. Pojmenuj první krok
feature_selection. - Do
paramspřidej dva páry klíč–hodnota: jeden pro počet příznakůkv selektoru s hodnotami 10 a 20, a druhý pron_estimatorsv lese s možnými hodnotami 2 a 5. - Inicializuj objekt
GridSearchCVs daným pipelinem a mřížkou parametrů. - Natrénuj objekt na datech a vypiš nejlepší kombinaci parametrů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create pipeline with feature selector and classifier
pipe = ___([
(___, SelectKBest(f_classif)),
('clf', ___(random_state=2))])
# Create a parameter grid
params = {
'feature_selection__k':___,
___:[2, 5]}
# Initialize the grid search object
grid_search = ___(___, ___=params)
# Fit it to the data and print the best value combination
print(grid_search.fit(___, ___).___)