Steg 3: Bygg en klassificerare
Det här är det sista steget i sentimentanalysens förutsägelse. Vi har utforskat och berikat vår datamängd med särdrag kopplade till sentiment, och skapat numeriska vektorer från den.
Du kommer att använda den datamängd som du byggde i de föregående stegen. Den innehåller ett särdrag för recensionernas längd samt 200 särdrag skapade med Tfidf-vektorn.
Din uppgift är att träna en logistisk regression för att förutsäga sentiment. Data har importerats åt dig och kallas reviews_transformed. Målvariabeln heter score och är binär: 1 när produktrecensionen är positiv och 0 annars.
Träna en logistisk regressionsmodell och utvärdera dess prestanda på testdata. Hur väl klarar sig modellen?
Alla nödvändiga paket har importerats åt dig.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Utför train/test-uppdelningen, tilldela 20 % av data till testning och sätt det slumpmässiga fröet till
456. - Träna en logistisk regressionsmodell.
- Förutsäg klassen.
- Skriv ut noggrannhetspoängen och konfusionsmatrisen för testmängden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)
# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)
# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)
# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))