Подсчёт слов (I)
После того как общая информация зафиксирована, можно приступать к созданию признаков на основе содержимого каждого текста. Один из подходов здесь схож с тем, как вы работали с категориальными переменными в предыдущих уроках.
- Для каждого уникального слова в наборе данных создаётся отдельный столбец.
- Для каждой записи подсчитывается, сколько раз это слово встречается, и результат записывается в соответствующий столбец.
Эти столбцы со счётчиками можно использовать для обучения моделей машинного обучения.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Инструкции к упражнению
- Импортируйте
CountVectorizerизsklearn.feature_extraction.text. - Создайте экземпляр
CountVectorizerи присвойте его переменнойcv. - Обучите векторайзер на столбце
text_clean. - Выведите на экран названия признаков, сгенерированных векторайзером.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)