Tfidf і BOW на тих самих даних
У цій вправі ви перетворите стовпець review із амазонівських reviews як за допомогою bag-of-words, так і через перетворення tfidf.
Побудуйте обидва векторизатори, вказавши лише максимальну кількість ознак, рівну 100. Створіть датафрейми після перетворення та виведіть перші 5 рядків кожного.
Будьте уважні, коли задаєте максимальну кількість ознак у словнику. Занадто великий словник може призвести до переривання вашого сеансу.
Ця вправа є частиною курсу
Аналіз тональності в Python
Інструкції до вправи
- Імпортуйте векторизатори BOW і Tfidf.
- Побудуйте та навчіть векторизатори BOW і Tfidf зі стовпця
reviewта обмежте кількість створених ознак до 100. - Створіть датафрейми з перетворених векторних подань.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())