Kom igångKom igång gratis

Ordförrådets storlek för filmrecensioner

I den här övningen får du öva på olika sätt att begränsa ordförrådets storlek med hjälp av ett urval från datamängden movies med filmrecensioner. Den första kolumnen är review, av typen object, och den andra kolumnen är label, där 0 står för en negativ recension och 1 för en positiv.

De tre metoderna du använder omvandlar textkolumnen till nya numeriska kolumner som fångar antalet förekomster av ett ord eller en fras i varje recension. Varje metod resulterar i att ett olika antal nya särdrag skapas.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)

# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Redigera och kör kod