ПочатиПочніть безкоштовно

Підрахунок слів (I)

Коли загальну інформацію вже зібрано, можна почати створювати ознаки на основі фактичного вмісту кожного тексту. Один зі способів — діяти подібно до того, як ви працювали з категоріальними змінними в попередніх уроках.

  • Для кожного унікального слова в наборі даних створюється стовпчик.
  • Для кожного запису підраховується, скільки разів це слово зустрічається, і це число заноситься до відповідного стовпчика.

Ці стовпчики з «counts» потім можна використовувати для навчання моделей машинного навчання.

Ця вправа є частиною курсу

Feature Engineering для машинного навчання в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте CountVectorizer з sklearn.feature_extraction.text.
  • Створіть екземпляр CountVectorizer і присвойте його змінній cv.
  • Навчіть векторизатор на стовпчику text_clean.
  • Виведіть назви ознак, згенеровані векторизатором.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import CountVectorizer
____

# Instantiate CountVectorizer
cv = ____

# Fit the vectorizer
cv.____(speech_df['text_clean'])

# Print feature names
print(cv.____)
Редагувати та запускати код