ÎncepețiÎncepe gratuit

Construirea unui model de pădure aleatorie

Vei lucra din nou pe setul de date Pima Indians pentru a prezice dacă o persoană are diabet – de data aceasta folosind un clasificator de tip pădure aleatorie (random forest). Vei antrena modelul pe datele de antrenament după împărțirea train-test și vei analiza valorile de importanță ale caracteristicilor.

Seturile de caracteristici și țintă au fost pre-încărcate ca X și y. La fel și pachetele și funcțiile necesare.

Acest exercițiu face parte din cursul

Reducerea dimensionalității în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Setează o proporție de 25% pentru testare, realizând o împărțire train-test de 75%-25%.
  • Antrenează clasificatorul de tip pădure aleatorie pe datele de antrenament.
  • Calculează acuratețea pe setul de testare.
  • Afișează importanța fiecărei caracteristici.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Perform a 75% training and 25% test data split
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=____, random_state=0)

# Fit the random forest model to the training data
rf = RandomForestClassifier(random_state=0)
rf.____(____, ____)

# Calculate the accuracy
acc = accuracy_score(____, ____)

# Print the importances per feature
print(dict(zip(X.columns, rf.____.round(2))))

# Print accuracy
print(f"{acc:.1%} accuracy on test set.") 
Editează și rulează codul