Підрахунок слів (I)
Коли загальну інформацію вже зібрано, можна почати створювати ознаки на основі фактичного вмісту кожного тексту. Один зі способів — діяти подібно до того, як ви працювали з категоріальними змінними в попередніх уроках.
- Для кожного унікального слова в наборі даних створюється стовпчик.
- Для кожного запису підраховується, скільки разів це слово зустрічається, і це число заноситься до відповідного стовпчика.
Ці стовпчики з «counts» потім можна використовувати для навчання моделей машинного навчання.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інструкції до вправи
- Імпортуйте
CountVectorizerзsklearn.feature_extraction.text. - Створіть екземпляр
CountVectorizerі присвойте його зміннійcv. - Навчіть векторизатор на стовпчику
text_clean. - Виведіть назви ознак, згенеровані векторизатором.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import CountVectorizer
____
# Instantiate CountVectorizer
cv = ____
# Fit the vectorizer
cv.____(speech_df['text_clean'])
# Print feature names
print(cv.____)