Začněte nyníZačněte zdarma

Krok 3: Sestavení klasifikátoru

Toto je poslední krok predikce analýzy sentimentu. Prozkoumali jsme datovou sadu, obohatili ji o příznaky související se sentimentem a převedli ji na číselné vektory.

Budeš pracovat s datovou sadou, kterou jsi sestavil/a v předchozích krocích. Obsahuje příznak pro délku recenzí a 200 příznaků vytvořených pomocí Tfidf vektorizéru.

Tvým úkolem je natrénovat logistickou regresi pro predikci sentimentu. Data jsou již načtena v proměnné reviews_transformed. Cílová proměnná se jmenuje score a je binární: 1 pro pozitivní recenzi produktu a 0 jinak.

Natrénuj model logistické regrese a vyhodnoť jeho výkon na testovacích datech. Jak si model vede?

Všechny potřebné balíčky jsou již naimportovány.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Rozděl data na trénovací a testovací sadu, přičemž 20 % dat alokuj pro testování a nastav náhodné semínko na 456.
  • Natrénuj model logistické regrese.
  • Předpověz třídu.
  • Vypiš skóre přesnosti a matici záměn na testovací sadě.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)

# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)

# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)

# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))
Upravit a spustit kód