Поиск наиболее часто встречающихся слов
После создания признаков всегда полезно изучить их и убедиться, что они соответствуют вашим ожиданиям. Это позволит обнаружить ошибки на раннем этапе и, возможно, определить, какая дополнительная инженерия признаков потребуется.
Векторизатор (cv), который вы обучили в предыдущем упражнении, и разреженный массив счётчиков слов (cv_trigram) доступны в вашем рабочем пространстве.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Инструкции к упражнению
- Создайте DataFrame из признаков (счётчиков слов).
- Просуммируйте количество вхождений слов и выведите 5 наиболее часто встречающихся.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())