Krok 3: Sestavení klasifikátoru
Toto je poslední krok predikce analýzy sentimentu. Prozkoumali jsme datovou sadu, obohatili ji o příznaky související se sentimentem a převedli ji na číselné vektory.
Budeš pracovat s datovou sadou, kterou jsi sestavil/a v předchozích krocích. Obsahuje příznak pro délku recenzí a 200 příznaků vytvořených pomocí Tfidf vektorizéru.
Tvým úkolem je natrénovat logistickou regresi pro predikci sentimentu. Data jsou již načtena v proměnné reviews_transformed. Cílová proměnná se jmenuje score a je binární: 1 pro pozitivní recenzi produktu a 0 jinak.
Natrénuj model logistické regrese a vyhodnoť jeho výkon na testovacích datech. Jak si model vede?
Všechny potřebné balíčky jsou již naimportovány.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Rozděl data na trénovací a testovací sadu, přičemž 20 % dat alokuj pro testování a nastav náhodné semínko na
456. - Natrénuj model logistické regrese.
- Předpověz třídu.
- Vypiš skóre přesnosti a matici záměn na testovací sadě.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)
# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)
# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)
# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))