1. Học hỏi
  2. /
  3. Khoa Học
  4. /
  5. Machine Learning với PySpark

Connected

Bài tập

Tải dữ liệu SMS spam

Bạn đã thấy có thể suy luận kiểu dữ liệu trực tiếp từ dữ liệu. Đôi khi sẽ tiện hơn nếu bạn kiểm soát trực tiếp kiểu của các cột. Bạn làm điều này bằng cách định nghĩa một schema tường minh.

Tệp sms.csv chứa một tập SMS đã được phân loại là 'spam' hoặc 'ham'. Dữ liệu này được điều chỉnh từ UCI Machine Learning Repository. Tổng cộng có 5574 SMS, trong đó 747 tin được gán nhãn spam.

Lưu ý về định dạng CSV:

  • không có dòng tiêu đề và
  • các trường được phân tách bằng dấu chấm phẩy (đây không phải là dấu phân tách mặc định).

Từ điển dữ liệu:

  • id — định danh bản ghi
  • text — nội dung tin nhắn SMS
  • label — spam hoặc ham (số nguyên; 0 = ham và 1 = spam)

Hướng dẫn

100 XP
  • Chỉ định schema dữ liệu với tên cột ("id", "text", và "label") và kiểu cột.
  • Đọc dữ liệu từ tệp phân tách ký tự có tên "sms.csv".
  • In schema của DataFrame kết quả.