Sestav a vyhodnoť model: recenze filmů
V tomto cvičení sestavíš model logistické regrese pomocí datasetu movies. Skóre je uloženo ve sloupci label a nabývá hodnoty 1 pro kladnou recenzi a 0 pro zápornou. Textové recenze byly převedeny pomocí metody BOW na číselné sloupce.
Model jsi už jednou sestavil/a, ale vyhodnotil/a jsi ho na stejných datech, která jsi použil/a při trénování. Teď se zaměř na vyhodnocení modelu na dosud neviděné testovací sadě. Jak se výkon modelu změní, když ho otestuješ na testovacích datech?
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Importuj funkci potřebnou pro rozdělení dat na trénovací a testovací část.
- Proveď rozdělení dat tak, aby 20 % sloužilo jako testovací sada.
- Natrénuj model logistické regrese.
- Vypiš přesnost modelu na trénovacích i testovacích datech.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the required packages
from sklearn.linear_model import LogisticRegression
____
# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)
# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)
# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))