Tiền xử lý dữ liệu
Bước đầu tiên trong quá trình phân khúc là tiền xử lý dữ liệu. Bạn sẽ áp dụng biến đổi log, sau đó chuẩn hóa dữ liệu để chuẩn bị cho việc phân cụm.
Chúng tôi đã tải sẵn bộ dữ liệu với các giá trị RFMT dưới tên datamart_rfmt. Ngoài ra, thư viện pandas đã được nạp dưới bí danh pd, và numpy là np.
Bạn có thể thoải mái khám phá bộ dữ liệu RFMT mở rộng trong bảng điều khiển (console).
Bài tập này là một phần của khóa học
Phân khúc khách hàng bằng Python
Hướng dẫn bài tập
- Import StandardScaler, khởi tạo và lưu là
scaler. - Áp dụng biến đổi log cho dữ liệu RFMT gốc.
- Khởi tạo scaler và fit nó trên dữ liệu đã biến đổi log.
- Transform và lưu dữ liệu đã chuẩn hóa thành
datamart_rfmt_normalized.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import StandardScaler
from ____.____ import ____
# Apply log transformation
datamart_rfmt_log = ____.____(____)
# Initialize StandardScaler and fit it
scaler = ____(); ____.fit(____)
# Transform and store the scaled data as datamart_rfmt_normalized
datamart_rfmt_normalized = ____.____(____)