Dimensiunea vocabularului recenziilor de filme
În acest exercițiu, vei exersa diferite metode de a limita dimensiunea vocabularului, folosind un eșantion din setul de date movies cu recenzii de filme. Prima coloană este review, de tip object, iar a doua coloană este label, cu valoarea 0 pentru o recenzie negativă și 1 pentru una pozitivă.
Cele trei metode pe care le vei folosi vor transforma coloana de text în coloane numerice noi, surprinzând numărul de apariții ale unui cuvânt sau ale unei expresii în fiecare recenzie. Fiecare metodă va genera, în final, un număr diferit de caracteristici noi.
Acest exercițiu face parte din cursul
Analiza sentimentelor în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())