Standardtröskel för klassificering
Du vill bekräfta att DecisionTreeClassifier() använder samma standardtröskel för klassificering som nämndes i föregående lektion, nämligen 0,5. Det verkar märkligt att alla klassificerare skulle använda samma tröskel – låt oss kontrollera det! En anpassad beslutsträdsklassificerare clf har laddats in i förväg, liksom tränings- och testdata med sina vanliga namn: X_train, X_test, y_train och y_test. Du behöver extrahera sannolikhetspoäng från klassificeraren med metoden .predict_proba().
Den här övningen är en del av kursen
Att designa maskininlärningsflöden i Python
Övningsinstruktioner
- Generera poäng för testexemplen med hjälp av den inladdade klassificeraren
clf. - Extrahera sedan etiketter från poängen. Tänk på att du har ett par poäng för varje exempel, inte ett enda värde, och att det andra elementet är sannolikheten för den positiva klassen.
- Etikettera testdata med den vanliga metoden
.predict(). - Jämför slutligen resultaten med de förutsägelser du fick tidigare. Är de identiska?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Score the test data using the given classifier
scores = clf.____(____)
# Get labels from the scores using the default threshold
preds = [s[____] > ____ for s in scores]
# Use the predict method to label the test data again
preds_default = clf.____(____)
# Compare the two sets of predictions
____(preds == preds_default)