Khám phá dữ liệu
Bộ dữ liệu salesData đã được nạp vào không gian làm việc. Nó chứa thông tin về khách hàng trong các tháng một đến ba. Chỉ có doanh số của tháng tư được đưa vào. Bảng sau mô tả một số biến có ý nghĩa chưa rõ ràng.
| Variable | Description |
|---|---|
| id | số định danh của khách hàng |
| mostFreqStore | cửa hàng mà người mua thường mua nhất |
| mostFreqCat | danh mục mà người mua mua nhiều nhất |
| nCats | số lượng danh mục khác nhau |
| preferredBrand | thương hiệu mà người mua chọn nhiều nhất |
| nBrands | số lượng thương hiệu khác nhau |
Các gói readr, dplyr, corrplot và ggplot2 đã được cài đặt và nạp.
Bài tập này là một phần của khóa học
Machine Learning cho Phân tích Marketing bằng R
Hướng dẫn bài tập
- Dùng lệnh xem cấu trúc
str()để có cái nhìn tổng quan về dữ liệu. - Bây giờ, trực quan hóa tương quan giữa các biến giải thích liên tục của ba tháng trước với biến doanh số của tháng này. Dùng các hàm
cor()vàcorrplot()cùng với toán tử pipe. Lưu ý rằng các biến phù hợp đã được chọn sẵn cho bạn. - Bên cạnh đó, vẽ boxplot thể hiện phân phối của
salesThisMontheo các mức của biến phân loạipreferredBrand. Điều tương tự đã được thực hiện cho biến phân loạimostFreqStore.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))