Din första pipeline – igen!
Tillbaka på arytmistartupen närmar sig din månatliga genomgång, och som en del av den kommer en erfaren Python-programmerare att granska din kod. Du bestämmer dig för att städa upp genom att följa bästa praxis och ersätta ditt skript för särdragsurval och random forest-klassificering med en pipeline. Du arbetar med en träningsdatamängd tillgänglig som X_train och y_train, samt ett antal moduler: RandomForestClassifier, SelectKBest() och f_classif() för särdragsurval, liksom GridSearchCV och Pipeline.
Den här övningen är en del av kursen
Att designa maskininlärningsflöden i Python
Övningsinstruktioner
- Skapa en pipeline med särdragsurvalet från exempelkoden och en random forest-klassificerare. Namnge det första steget
feature_selection. - Lägg till två nyckel-värde-par i
params: ett för antalet särdragki urvalet med värdena 10 och 20, och ett förn_estimatorsi skogen med möjliga värden 2 och 5. - Initiera ett
GridSearchCV-objekt med den angivna pipelinen och parameterrutnätet. - Anpassa objektet till datan och skriv ut den bästa parameterkombinationen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create pipeline with feature selector and classifier
pipe = ___([
(___, SelectKBest(f_classif)),
('clf', ___(random_state=2))])
# Create a parameter grid
params = {
'feature_selection__k':___,
___:[2, 5]}
# Initialize the grid search object
grid_search = ___(___, ___=params)
# Fit it to the data and print the best value combination
print(grid_search.fit(___, ___).___)