1. Learn
  2. /
  3. Курси
  4. /
  5. Feature Engineering для машинного навчання в Python

Connected

Вправа

Використання довших n-грам

Дотепер ви створювали ознаки на основі окремих слів у кожному тексті. Це може бути доволі потужним у моделі машинного навчання, але може турбувати, що за розгляду слів окремо втрачається багато контексту. Щоб врахувати це під час побудови моделей, можна використовувати n-грами — послідовності з n слів, згрупованих разом. Наприклад:

  • біграми: послідовності з двох сусідніх слів
  • триграми: послідовності з трьох сусідніх слів

Їх можна автоматично створити у вашому наборі даних, вказавши аргумент ngram_range як кортеж (n1, n2), де включаються всі n-грами в діапазоні від n1 до n2.

Інструкції

100 XP
  • Імпортуйте CountVectorizer з sklearn.feature_extraction.text.
  • Створіть екземпляр CountVectorizer, враховуючи лише триграми.
  • Виконайте навчання векторизатора та застосуйте його до стовпця text_clean в одному кроці.
  • Виведіть назви ознак, згенеровані векторизатором.