Bygg och utvärdera en modell: produktrecensioner
I den här övningen bygger du en logistisk regression med hjälp av datamängden reviews, som innehåller kunders recensioner av Amazon-produkter. Arrayen y innehåller sentimentet: 1 om det är positivt och 0 annars. Arrayen X innehåller alla numeriska särdrag skapade med en BOW-metod. Utforska dem gärna i IPython Shell.
Din uppgift är att bygga en logistisk regressionsmodell och beräkna noggrannheten och konfusionsmatrisen med hjälp av testdatan.
Funktionerna för logistisk regression och träning/testuppdelning har redan importerats åt dig.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Importera funktionerna för noggrannhetspoäng och konfusionsmatris.
- Dela upp datan i träning och test, använd 30 % som testset och sätt det slumpmässiga frövärdet till
42. - Träna en logistisk regressionsmodell.
- Skriv ut noggrannhetspoängen och konfusionsmatrisen med hjälp av testdatan.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the accuracy and confusion matrix
____
# Split the data into training and testing
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.3, ____=42)
# Build a logistic regression
log_reg = ____._____
# Predict the labels
y_predict = log_reg.predict(X_test)
# Print the performance metrics
print('Accuracy score of test data: ', ____(____, ____))
print('Confusion matrix of test data: \n', ____(____, ____)/len(y_test))