Primul tău pipeline – din nou!
La startup-ul de aritmie, se apropie evaluarea lunară, iar în cadrul acesteia un programator Python experimentat îți va revizui codul. Decizi să faci ordine urmând bunele practici și să înlocuiești scriptul de selecție a caracteristicilor și clasificare cu păduri aleatoare cu un pipeline. Folosești un set de antrenament disponibil ca X_train și y_train, precum și o serie de module: RandomForestClassifier, SelectKBest() și f_classif() pentru selecția caracteristicilor, alături de GridSearchCV și Pipeline.
Acest exercițiu face parte din cursul
Proiectarea fluxurilor de lucru pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Creează un pipeline cu selectorul de caracteristici dat în codul exemplu și un clasificator de tip pădure aleatoare. Numește primul pas
feature_selection. - Adaugă două perechi cheie-valoare în
params: una pentru numărul de caracteristicikdin selector, cu valorile 10 și 20, și una pentrun_estimatorsîn pădure, cu valorile posibile 2 și 5. - Inițializează un obiect
GridSearchCVcu pipeline-ul și grila de parametri date. - Antrenează obiectul pe date și afișează combinația de parametri cu cea mai bună performanță.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create pipeline with feature selector and classifier
pipe = ___([
(___, SelectKBest(f_classif)),
('clf', ___(random_state=2))])
# Create a parameter grid
params = {
'feature_selection__k':___,
___:[2, 5]}
# Initialize the grid search object
grid_search = ___(___, ___=params)
# Fit it to the data and print the best value combination
print(grid_search.fit(___, ___).___)