1. Learn
  2. /
  3. Cursuri
  4. /
  5. Machine Learning với PySpark

Connected

Exercițiu

Pipeline cho SMS spam

Bạn đã không xem dữ liệu SMS một thời gian rồi. Lần trước chúng ta đã thực hiện các bước sau:

  • tách văn bản thành các token
  • loại bỏ stop words
  • áp dụng hashing trick
  • chuyển đổi dữ liệu từ số đếm sang IDF và
  • huấn luyện một mô hình logistic regression.

Mỗi bước trên đều được thực hiện riêng lẻ. Đây rõ ràng là một ứng dụng tuyệt vời cho pipeline!

Các lớp Pipeline và LogisticRegression đã được nhập sẵn trong phiên, nên bạn không cần lo về phần đó!

Instrucțiuni

100 XP
  • Tạo một đối tượng để tách văn bản thành các token.
  • Tạo một đối tượng để loại bỏ stop words. Thay vì chỉ rõ tên cột đầu vào, hãy dùng phương thức getOutputCol() trên đối tượng trước đó.
  • Tạo các đối tượng để áp dụng hashing trick và biến đổi dữ liệu sang TF-IDF. Tiếp tục dùng phương thức getOutputCol().
  • Tạo một pipeline bao gồm tất cả các bước trên cũng như một đối tượng để tạo mô hình Logistic Regression.