Размер словаря для рецензий на фильмы
В этом упражнении вы попрактикуетесь в различных способах ограничения размера словаря на примере выборки из набора данных movies с рецензиями на фильмы. Первый столбец — review — имеет тип object, второй столбец — label — принимает значение 0 для отрицательной рецензии и 1 для положительной.
Три метода, которые вы будете использовать, преобразуют текстовый столбец в новые числовые столбцы, фиксируя количество вхождений слова или фразы в каждой рецензии. Каждый метод в итоге приведёт к формированию разного числа новых признаков.
Это упражнение является частью курса
Анализ тональности текста на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify size of vocabulary and fit
vect = CountVectorizer(____=____)
vect.fit(movies.review)
# Transform the review column
X_review = vect.transform(movies.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.get_feature_names())
print(X_df.head())