Kom igångKom igång gratis

Visualisering av klassificeringsmodellers prestanda

I den här övningen ska du lösa ett klassificeringsproblem där kolumnen "popularity" i datamängden music_df har konverterats till binära värden. Värdet 1 innebär att en låts popularitet är större än eller lika med medianvärdet för kolumnen "popularity", och 0 innebär att populariteten ligger under medianen.

Din uppgift är att bygga och visualisera resultaten från tre olika modeller som klassificerar om en låt är populär eller inte.

Datan har delats upp, skalats och förladdats åt dig som X_train_scaled, X_test_scaled, y_train och y_test. Dessutom har KNeighborsClassifier, DecisionTreeClassifier och LogisticRegression importerats.

Den här övningen är en del av kursen

Övervakad inlärning med scikit-learn

Visa kurs

Övningsinstruktioner

  • Skapa en ordbok med nycklarna "Logistic Regression", "KNN" och "Decision Tree Classifier", och sätt ordbokens värden till ett anrop av respektive modell.
  • Loopa igenom värdena i models.
  • Instantiera ett KFold-objekt för att utföra 6 uppdelningar, och sätt shuffle till True och random_state till 12.
  • Utför korsvalidering med hjälp av modellen, de skalade träningssärdragen, träningens måluppsättning och sätt cv lika med kf.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create models dictionary
models = {"____": ____(), "____": ____(), "____": ____()}
results = []

# Loop through the models' values
for model in ____.____():
  
  # Instantiate a KFold object
  kf = ____(n_splits=____, random_state=____, shuffle=____)
  
  # Perform cross-validation
  cv_results = ____(____, ____, ____, cv=____)
  results.append(cv_results)
plt.boxplot(results, labels=models.keys())
plt.show()
Redigera och kör kod