Baslinje
Det är viktigt att utvärdera en klassificerare i förhållande till en lämplig baslinje. Det gäller särskilt för obalanserade datamängder, till exempel klickfrekvens för annonser, eftersom hög träffsäkerhet lätt uppnås genom att alltid välja majoritetsklassen. I den här övningen simulerar du en baslinjesklassificerare som alltid förutsäger majoritetsklassen (inget klick) och undersöker dess förväxlingsmatris samt dess precision och recall.
X_train, y_train, X_test och y_test finns tillgängliga i din arbetsyta. pandas som pd, numpy som np och sklearn finns också tillgängliga i din arbetsyta.
Den här övningen är en del av kursen
Förutsäga CTR med maskininlärning i Python
Övningsinstruktioner
- Skapa
y_predsom en array med nollor och samma längd somX_testmed hjälp avnp.asarray(). - Skriv ut den resulterande förväxlingsmatrisen.
- Hämta precision- och recall-värdena.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set up baseline predictions
y_pred = np.____([0 for x in range(len(X_test))])
# Look at confusion matrix
print("Confusion matrix: ")
print(____(y_test, y_pred))
# Check precision and recall
prec = ____(y_test, y_pred, average = 'weighted')
recall = ____(y_test, y_pred, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))