Пошук найуживаніших слів
Після створення ознак завжди варто їх переглянути, щоб переконатися, що все відповідає очікуванням. Це допоможе рано виявити помилки і, можливо, вплине на подальшу інженерію ознак.
Векторизатор (cv), який ви натренували у попередній вправі, та розріджений масив із підрахунками слів (cv_trigram) доступні у вашому робочому просторі.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Створіть DataFrame з ознак (підрахунків слів).
- Додайте підсумкові підрахунки появ слів і виведіть 5 найчастотніших слів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())