НачатьНачать бесплатно

Подсчёт слов (I)

После того как общая информация зафиксирована, можно приступать к созданию признаков на основе содержимого каждого текста. Один из подходов здесь схож с тем, как вы работали с категориальными переменными в предыдущих уроках.

  • Для каждого уникального слова в наборе данных создаётся отдельный столбец.
  • Для каждой записи подсчитывается, сколько раз это слово встречается, и результат записывается в соответствующий столбец.

Эти столбцы со счётчиками можно использовать для обучения моделей машинного обучения.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте CountVectorizer из sklearn.feature_extraction.text.
  • Создайте экземпляр CountVectorizer и присвойте его переменной cv.
  • Обучите векторайзер на столбце text_clean.
  • Выведите на экран названия признаков, сгенерированных векторайзером.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
Редактировать и запускать код