Začněte nyníZačněte zdarma

Recenze produktů s regularizací

V tomto cvičení opět pracuješ s datasetem reviews obsahujícím recenze produktů z Amazonu. Vektor popisků y obsahuje sentiment: 1 pro pozitivní a 0 pro ostatní případy. Matice X obsahuje všechny numerické příznaky vytvořené pomocí přístupu BOW.

Budeš trénovat dva modely logistické regrese s různou mírou regularizace a porovnáš jejich výkonnost na testovacích datech. Připomeň si, že regularizace slouží k řízení složitosti modelu. Čím vyšší je regularizace, tím méně je model flexibilní, ale lépe generalizuje. Modely s vyšší mírou regularizace bývají méně přesné než modely bez regularizace.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Rozděl data na trénovací a testovací sadu.
  • Natrénuj logistickou regresi s parametrem regularizace 1000. Poté natrénuj druhou logistickou regresi s parametrem regularizace 0.001.
  • Vytiskni skóre přesnosti obou modelů na testovací sadě.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)

# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)

# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))
Upravit a spustit kód