डेटा पर नज़र डालना
वर्कस्पेस में डेटासेट salesData लोड है. इसमें महीना 1 से 3 तक के कस्टमर्स की जानकारी है. केवल महीने 4 की sales शामिल है. नीचे दी गई तालिका में कुछ ऐसे वैरिएबल्स का विवरण है जिनका अर्थ सीधा स्पष्ट नहीं है.
| Variable | Description |
|---|---|
| id | कस्टमर का पहचान नंबर |
| mostFreqStore | वह स्टोर जिससे व्यक्ति ने सबसे अधिक खरीदा |
| mostFreqCat | वह श्रेणी जिससे व्यक्ति ने सबसे अधिक खरीदारी की |
| nCats | अलग-अलग श्रेणियों की संख्या |
| preferredBrand | वह ब्रांड जिसे व्यक्ति ने सबसे अधिक खरीदा |
| nBrands | अलग-अलग ब्रांड्स की संख्या |
पैकेज readr, dplyr, corrplot, और ggplot2 इंस्टॉल और लोड कर दिए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Marketing Analytics के लिए Machine Learning
अभ्यास निर्देश
- डेटा का ओवरव्यू पाने के लिए structure कमांड
str()का उपयोग कीजिए. - अब पिछले तीन महीनों के continuous explanatory वैरिएबल्स और इस महीने के sales वैरिएबल के बीच correlation को विज़ुअलाइज़ कीजिए. इसके लिए
cor()औरcorrplot()फंक्शन्स और pipe ऑपरेटर का उपयोग करें. ध्यान दें कि आपके लिए सही वैरिएबल्स पहले से चुने हुए हैं. - साथ ही, श्रेणीबद्ध वैरिएबल
preferredBrandके levels के आधार परsalesThisMonके वितरण को दिखाने के लिए एक boxplot बनाइए. श्रेणीबद्ध आश्रित वैरिएबलmostFreqStoreके लिए यही काम पहले से किया गया है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Structure of dataset
str(___, give.attr = FALSE)
# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
select(-id) %>%
___
___
# Frequent stores
ggplot(salesData) +
geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))
# Preferred brand
ggplot(___) +
geom_boxplot(aes(x = ___, y = ___))