สำรวจข้อมูล
ชุดข้อมูล salesData ถูกโหลดไว้ใน workspace แล้ว โดยมีข้อมูลของลูกค้าในช่วงเดือนที่หนึ่งถึงสาม และมีเพียงข้อมูลยอดขายของเดือนที่สี่เท่านั้น ตารางด้านล่างอธิบายความหมายของตัวแปรบางตัวที่อาจไม่คุ้นเคย
| ตัวแปร | คำอธิบาย |
|---|---|
| id | หมายเลขประจำตัวลูกค้า |
| mostFreqStore | ร้านที่ลูกค้าซื้อสินค้าบ่อยที่สุด |
| mostFreqCat | หมวดหมู่สินค้าที่ลูกค้าซื้อบ่อยที่สุด |
| nCats | จำนวนหมวดหมู่สินค้าที่แตกต่างกัน |
| preferredBrand | แบรนด์ที่ลูกค้าซื้อบ่อยที่สุด |
| nBrands | จำนวนแบรนด์ที่แตกต่างกัน |
แพ็กเกจ readr, dplyr, corrplot และ ggplot2 ได้รับการติดตั้งและโหลดไว้เรียบร้อยแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning for Marketing Analytics ใน R
คำแนะนำการฝึกหัด
- ใช้คำสั่ง
str()เพื่อดูภาพรวมของข้อมูล - แสดงภาพความสัมพันธ์ระหว่างตัวแปรอธิบายแบบต่อเนื่องในช่วงสามเดือนที่ผ่านมากับตัวแปรยอดขายของเดือนนี้ โดยใช้ฟังก์ชัน
cor()และcorrplot()ร่วมกับ pipe operator ทั้งนี้ตัวแปรที่เกี่ยวข้องได้รับการเลือกไว้ให้แล้ว - สร้าง boxplot แสดงการกระจายของ
salesThisMonตามระดับของตัวแปรเชิงกลุ่มpreferredBrandโดยขั้นตอนเดียวกันนี้ได้ทำไว้แล้วสำหรับตัวแปรเชิงกลุ่มmostFreqStore
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))