ÎncepețiÎncepe gratuit

Dimensiunea vocabularului recenziilor de filme

În acest exercițiu, vei exersa diferite metode de a limita dimensiunea vocabularului, folosind un eșantion din setul de date movies cu recenzii de filme. Prima coloană este review, de tip object, iar a doua coloană este label, cu valoarea 0 pentru o recenzie negativă și 1 pentru una pozitivă.

Cele trei metode pe care le vei folosi vor transforma coloana de text în coloane numerice noi, surprinzând numărul de apariții ale unui cuvânt sau ale unei expresii în fiecare recenzie. Fiecare metodă va genera, în final, un număr diferit de caracteristici noi.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)

# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Editează și rulează codul