Bắt đầu ngayBắt đầu miễn phí

Tiền xử lý dữ liệu

Bước đầu tiên trong quá trình phân khúc là tiền xử lý dữ liệu. Bạn sẽ áp dụng biến đổi log, sau đó chuẩn hóa dữ liệu để chuẩn bị cho việc phân cụm.

Chúng tôi đã tải sẵn bộ dữ liệu với các giá trị RFMT dưới tên datamart_rfmt. Ngoài ra, thư viện pandas đã được nạp dưới bí danh pd, và numpynp.

Bạn có thể thoải mái khám phá bộ dữ liệu RFMT mở rộng trong bảng điều khiển (console).

Bài tập này là một phần của khóa học

Phân khúc khách hàng bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import StandardScaler, khởi tạo và lưu là scaler.
  • Áp dụng biến đổi log cho dữ liệu RFMT gốc.
  • Khởi tạo scaler và fit nó trên dữ liệu đã biến đổi log.
  • Transform và lưu dữ liệu đã chuẩn hóa thành datamart_rfmt_normalized.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import StandardScaler 
from ____.____ import ____

# Apply log transformation
datamart_rfmt_log = ____.____(____)

# Initialize StandardScaler and fit it 
scaler = ____(); ____.fit(____)

# Transform and store the scaled data as datamart_rfmt_normalized
datamart_rfmt_normalized = ____.____(____)
Chỉnh sửa và Chạy Mã