Kom igångKom igång gratis

Sätt ihop allt

Du har precis börjat på ett startup inom arytmidetektering och vill träna en modell på arytmidatamängden arrh. Du har noterat att slumpskogar ofta presterar väl i Kaggle-tävlingar och vill prova det med ett maximalt djup på 2, 5 eller 10 med hjälp av grid search. Du märker också att datamängdens dimension är ganska hög, så du vill undersöka effekten av en metod för särdragsval.

För att undvika överanpassning har du redan delat upp dina data. Du använder X_train och y_train för grid search, och X_test och y_test för att avgöra om särdragsval är till hjälp. Alla fyra datamängdsfolder är förinlästa i din miljö. Du har också tillgång till GridSearchCV(), train_test_split(), SelectKBest(), chi2() och RandomForestClassifier som rfc.

Den här övningen är en del av kursen

Att designa maskininlärningsflöden i Python

Visa kurs

Övningsinstruktioner

  • Använd grid search för att testa ett maximalt djup på 2, 5 och 10 för RandomForestClassifier och spara den bäst presterande parameterinställningen.
  • Träna om estimatorn med det bäst presterande antalet estimatorer som du fastställde ovan.
  • Tillämpa särdragsselektor SelectKBest med poängfunktionen chi2 och träna om klassificeraren.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Find the best value for max_depth among values 2, 5 and 10
grid_search = GridSearchCV(
  ____(random_state=1), param_grid=____)
best_value = grid_search.____(
  ____, ____).best_params_['max_depth']

# Using the best value from above, fit a random forest
clf = rfc(
  random_state=1, ____=best_value).____(X_train, y_train)

# Apply SelectKBest with chi2 and pick top 100 features
vt = SelectKBest(____, k=____).____(X_train, y_train)

# Create a new dataset only containing the selected features
X_train_reduced = ____.transform(____)
Redigera och kör kod