1. Learn
  2. /
  3. Курси
  4. /
  5. Machine Learning з PySpark

Connected

Вправа

Стоп-слова та хешування

Далі потрібно вилучити stopwords, а потім застосувати трюк хешування, перетворивши результати на TF-IDF.

Коротке нагадування про ці поняття:

  • Трюк хешування забезпечує швидкий та ощадний за пам'яттю спосіб відображення дуже великої (можливо, нескінченної) множини елементів (у нашому випадку всіх слів із SMS) на меншу, скінченну кількість значень.
  • Матриця TF-IDF відображає, наскільки важливе слово для кожного документа. Вона враховує як частоту слова в межах кожного документа, так і частоту цього слова в усіх документах колекції.

Токенізовані дані SMS збережено в sms у стовпці words. Ви впорядкували пробіли в даних, тож токенізований текст став акуратнішим.

Інструкції

100 XP
  • Імпортуйте класи StopWordsRemover, HashingTF і IDF.
  • Створіть об'єкт StopWordsRemover (вхідний стовпець words, вихідний стовпець terms). Застосуйте до sms.
  • Створіть об'єкт HashingTF (вхід — результати з попереднього кроку, вихідний стовпець hash). Застосуйте до wrangled.
  • Створіть об'єкт IDF (вхід — результати з попереднього кроку, вихідний стовпець features). Застосуйте до wrangled.