Kom igångKom igång gratis

Din första pipeline – igen!

Tillbaka på arytmistartupen närmar sig din månatliga genomgång, och som en del av den kommer en erfaren Python-programmerare att granska din kod. Du bestämmer dig för att städa upp genom att följa bästa praxis och ersätta ditt skript för särdragsurval och random forest-klassificering med en pipeline. Du arbetar med en träningsdatamängd tillgänglig som X_train och y_train, samt ett antal moduler: RandomForestClassifier, SelectKBest() och f_classif() för särdragsurval, liksom GridSearchCV och Pipeline.

Den här övningen är en del av kursen

Att designa maskininlärningsflöden i Python

Visa kurs

Övningsinstruktioner

  • Skapa en pipeline med särdragsurvalet från exempelkoden och en random forest-klassificerare. Namnge det första steget feature_selection.
  • Lägg till två nyckel-värde-par i params: ett för antalet särdrag k i urvalet med värdena 10 och 20, och ett för n_estimators i skogen med möjliga värden 2 och 5.
  • Initiera ett GridSearchCV-objekt med den angivna pipelinen och parameterrutnätet.
  • Anpassa objektet till datan och skriv ut den bästa parameterkombinationen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create pipeline with feature selector and classifier
pipe = ___([
    (___, SelectKBest(f_classif)),
    ('clf', ___(random_state=2))])

# Create a parameter grid
params = {
   'feature_selection__k':___,
    ___:[2, 5]}

# Initialize the grid search object
grid_search = ___(___, ___=params)

# Fit it to the data and print the best value combination
print(grid_search.fit(___, ___).___)
Redigera och kör kod