Kom igångKom igång gratis

Bygga en random forest-modell

Du kommer återigen att arbeta med Pima Indians-datamängden för att förutsäga om en individ har diabetes – den här gången med hjälp av en random forest-klassificerare. Du tränar modellen på träningsdata efter att ha delat upp datamängden och undersöker sedan särdragets viktvärden.

Särdragsdatamängden och måldatamängden har förhandsladdats åt dig som X och y. Detsamma gäller för nödvändiga paket och funktioner.

Den här övningen är en del av kursen

Dimensionsreduktion i Python

Visa kurs

Övningsinstruktioner

  • Ange en teststorlek på 25 % för att utföra en 75–25-uppdelning i tränings- och testdata.
  • Träna random forest-klassificeraren på träningsdatan.
  • Beräkna noggrannheten på testmängden.
  • Skriv ut särdragsvikterna för varje särdrag.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)

# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)

# Calculate the accuracy
acc = accuracy_score(____, ____)

# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))

# Print accuracy
print(f"{acc:.1%} accuracy on test set.") 
Redigera och kör kod