Recenze produktů s regularizací
V tomto cvičení opět pracuješ s datasetem reviews obsahujícím recenze produktů z Amazonu. Vektor popisků y obsahuje sentiment: 1 pro pozitivní a 0 pro ostatní případy. Matice X obsahuje všechny numerické příznaky vytvořené pomocí přístupu BOW.
Budeš trénovat dva modely logistické regrese s různou mírou regularizace a porovnáš jejich výkonnost na testovacích datech. Připomeň si, že regularizace slouží k řízení složitosti modelu. Čím vyšší je regularizace, tím méně je model flexibilní, ale lépe generalizuje. Modely s vyšší mírou regularizace bývají méně přesné než modely bez regularizace.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Rozděl data na trénovací a testovací sadu.
- Natrénuj logistickou regresi s parametrem regularizace
1000. Poté natrénuj druhou logistickou regresi s parametrem regularizace0.001. - Vytiskni skóre přesnosti obou modelů na testovací sadě.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)
# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)
# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))