Tfidf и мешок слов на одних данных
В этом упражнении вы преобразуете столбец review набора данных Amazon reviews, применив оба метода: мешок слов и TF-IDF.
Создайте оба векторизатора, задав максимальное количество признаков равным 100. Сформируйте DataFrame после каждого преобразования и выведите первые 5 строк каждого из них.
Обратите внимание на ограничение размера словаря. Слишком большой словарь может привести к разрыву сессии.
Это упражнение является частью курса
Анализ тональности текста на Python
Инструкции к упражнению
- Импортируйте векторизаторы BOW и Tfidf.
- Создайте и обучите векторизатор BOW и векторизатор Tfidf на основе столбца
review, ограничив количество создаваемых признаков до 100. - Создайте DataFrame из полученных векторных представлений.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())