ПочатиПочніть безкоштовно

Tfidf і BOW на тих самих даних

У цій вправі ви перетворите стовпець review із амазонівських reviews як за допомогою bag-of-words, так і через перетворення tfidf.

Побудуйте обидва векторизатори, вказавши лише максимальну кількість ознак, рівну 100. Створіть датафрейми після перетворення та виведіть перші 5 рядків кожного.

Будьте уважні, коли задаєте максимальну кількість ознак у словнику. Занадто великий словник може призвести до переривання вашого сеансу.

Ця вправа є частиною курсу

Аналіз тональності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте векторизатори BOW і Tfidf.
  • Побудуйте та навчіть векторизатори BOW і Tfidf зі стовпця review та обмежте кількість створених ознак до 100.
  • Створіть датафрейми з перетворених векторних подань.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
Редагувати та запускати код