Začněte nyníZačněte zdarma

Velikost slovníku recenzí filmů

V tomto cvičení si procvičíš různé způsoby, jak omezit velikost slovníku – použijeme k tomu vzorek datasetu movies s recenzemi filmů. První sloupec obsahuje review (recenzi) typu object a druhý sloupec je label, kde 0 označuje negativní recenzi a 1 pozitivní.

Tři metody, které použiješ, převedou textový sloupec na nové číselné sloupce zachycující počet výskytů daného slova nebo fráze v každé recenzi. Každá metoda nakonec vytvoří jiný počet nových příznaků.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)

# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())
Upravit a spustit kód