Kom igångKom igång gratis

Produktrecensioner med regularisering

I den här övningen arbetar du återigen med datamängden reviews med Amazon-produktrecensioner. En vektor med etiketter y innehåller sentimentet: 1 om det är positivt och 0 annars. Matrisen X innehåller alla numeriska särdrag som skapats med en BOW-metod.

Du ska träna två logistiska regressionsmodeller med olika regulariseringsnivåer och jämföra hur de presterar på testdata. Kom ihåg att regularisering är ett sätt att kontrollera modellens komplexitet. Ju mer regulariserad en modell är, desto mindre flexibel är den – men desto bättre kan den generalisera. Modeller med hög regulariseringsnivå är ofta mindre noggranna än icke-regulariserade modeller.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Dela upp data i ett tränings- och ett testset.
  • Träna en logistisk regression med regulariseringsparametern 1000. Träna en andra logistisk regression med regulariseringsparametern 0.001.
  • Skriv ut noggrannhetspoängen för båda modellerna på testdatan.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Split data into training and testing
____, ____, ____, ____ = train_test_split(____, ____, test_size=0.2, random_state=123)

# Train a logistic regression with regularization of 1000
log_reg1 = ____(____=1000).fit(X_train, y_train)
# Train a logistic regression with regularization of 0.001
log_reg2 = ____(____=0.001).fit(X_train, y_train)

# Print the accuracies
print('Accuracy of model 1: ', log_reg1.____(____, ____))
print('Accuracy of model 2: ', log_reg2.____(____, ____))
Redigera och kör kod