НачатьНачать бесплатно

Tfidf и мешок слов на одних данных

В этом упражнении вы преобразуете столбец review набора данных Amazon reviews, применив оба метода: мешок слов и TF-IDF.

Создайте оба векторизатора, задав максимальное количество признаков равным 100. Сформируйте DataFrame после каждого преобразования и выведите первые 5 строк каждого из них.

Обратите внимание на ограничение размера словаря. Слишком большой словарь может привести к разрыву сессии.

Это упражнение является частью курса

Анализ тональности текста на Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте векторизаторы BOW и Tfidf.
  • Создайте и обучите векторизатор BOW и векторизатор Tfidf на основе столбца review, ограничив количество создаваемых признаков до 100.
  • Создайте DataFrame из полученных векторных представлений.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
Редактировать и запускать код