1. Học hỏi
  2. /
  3. Khoa Học
  4. /
  5. Machine Learning với PySpark

Connected

Bài tập

Dấu câu, chữ số và token

Cuối chương trước, bạn đã nạp một tập dữ liệu tin nhắn SMS được gán nhãn là "spam" (nhãn 1) hoặc "ham" (nhãn 0). Giờ bạn sẽ dùng dữ liệu đó để xây dựng một mô hình phân loại.

Nhưng trước hết, bạn cần chuẩn bị các tin nhắn SMS như sau:

  • loại bỏ dấu câu và chữ số
  • tokenize (tách thành từng từ riêng lẻ)
  • loại bỏ stop words
  • áp dụng hashing trick
  • chuyển sang biểu diễn TF-IDF.

Trong bài này, bạn sẽ loại bỏ dấu câu và chữ số, rồi tokenize các tin nhắn.

Dữ liệu SMS có sẵn dưới tên sms.

Hướng dẫn

100 XP
  • Import hàm thay thế bằng biểu thức chính quy và công cụ tokenize đặc trưng.
  • Thay tất cả ký tự dấu câu trong cột text bằng một khoảng trắng. Làm tương tự với tất cả chữ số trong cột text.
  • Tách cột text thành các token. Đặt tên cột đầu ra là words.