1. Learn
  2. /
  3. Курси
  4. /
  5. Machine Learning з PySpark

Connected

Вправа

Пунктуація, числа й токени

Наприкінці попереднього розділу ви завантажили набір даних із SMS‑повідомленнями, які було позначено як «spam» (мітка 1) або «ham» (мітка 0). Тепер ви використаєте ці дані, щоб побудувати модель класифікації.

Але спершу потрібно підготувати SMS‑повідомлення так:

  • вилучити пунктуацію та числа
  • токенізувати (розбити на окремі слова)
  • вилучити стоп-слова
  • застосувати hashing trick
  • перетворити у представлення TF‑IDF.

У цій вправі ви вилучите пунктуацію та числа, а потім виконаєте токенізацію повідомлень.

Дані SMS доступні як sms.

Інструкції

100 XP
  • Імпортуйте функцію для заміни за регулярним виразом і компонент для токенізації.
  • Замініть усі символи пунктуації в стовпці text на пробіл. Зробіть те саме для всіх чисел у стовпці text.
  • Розбийте стовпець text на токени. Назвіть вихідний стовпець words.