Velikost slovníku recenzí filmů
V tomto cvičení si procvičíš různé způsoby, jak omezit velikost slovníku – použijeme k tomu vzorek datasetu movies s recenzemi filmů. První sloupec obsahuje review (recenzi) typu object a druhý sloupec je label, kde 0 označuje negativní recenzi a 1 pozitivní.
Tři metody, které použiješ, převedou textový sloupec na nové číselné sloupce zachycující počet výskytů daného slova nebo fráze v každé recenzi. Každá metoda nakonec vytvoří jiný počet nových příznaků.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())