НачатьНачать бесплатно

Поиск наиболее часто встречающихся слов

После создания признаков всегда полезно изучить их и убедиться, что они соответствуют вашим ожиданиям. Это позволит обнаружить ошибки на раннем этапе и, возможно, определить, какая дополнительная инженерия признаков потребуется.

Векторизатор (cv), который вы обучили в предыдущем упражнении, и разреженный массив счётчиков слов (cv_trigram) доступны в вашем рабочем пространстве.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Инструкции к упражнению

  • Создайте DataFrame из признаков (счётчиков слов).
  • Просуммируйте количество вхождений слов и выведите 5 наиболее часто встречающихся.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create a DataFrame of the features
cv_tri_df = ____(____, 
                 columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')

# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())
Редактировать и запускать код