शुरू करेंमुफ़्त में शुरू करें

डेटा पर नज़र डालना

वर्कस्पेस में डेटासेट salesData लोड है. इसमें महीना 1 से 3 तक के कस्टमर्स की जानकारी है. केवल महीने 4 की sales शामिल है. नीचे दी गई तालिका में कुछ ऐसे वैरिएबल्स का विवरण है जिनका अर्थ सीधा स्पष्ट नहीं है.

Variable Description
id कस्टमर का पहचान नंबर
mostFreqStore वह स्टोर जिससे व्यक्ति ने सबसे अधिक खरीदा
mostFreqCat वह श्रेणी जिससे व्यक्ति ने सबसे अधिक खरीदारी की
nCats अलग-अलग श्रेणियों की संख्या
preferredBrand वह ब्रांड जिसे व्यक्ति ने सबसे अधिक खरीदा
nBrands अलग-अलग ब्रांड्स की संख्या

पैकेज readr, dplyr, corrplot, और ggplot2 इंस्टॉल और लोड कर दिए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Marketing Analytics के लिए Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • डेटा का ओवरव्यू पाने के लिए structure कमांड str() का उपयोग कीजिए.
  • अब पिछले तीन महीनों के continuous explanatory वैरिएबल्स और इस महीने के sales वैरिएबल के बीच correlation को विज़ुअलाइज़ कीजिए. इसके लिए cor() और corrplot() फंक्शन्स और pipe ऑपरेटर का उपयोग करें. ध्यान दें कि आपके लिए सही वैरिएबल्स पहले से चुने हुए हैं.
  • साथ ही, श्रेणीबद्ध वैरिएबल preferredBrand के levels के आधार पर salesThisMon के वितरण को दिखाने के लिए एक boxplot बनाइए. श्रेणीबद्ध आश्रित वैरिएबल mostFreqStore के लिए यही काम पहले से किया गया है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Structure of dataset
str(___, give.attr = FALSE)

# Visualization of correlations
salesData %>% select_if(is.numeric) %>%
  select(-id) %>%
  ___
  ___

# Frequent stores
ggplot(salesData) +
    geom_boxplot(aes(x = mostFreqStore, y = salesThisMon))

# Preferred brand
ggplot(___) +
    geom_boxplot(aes(x = ___, y = ___))
कोड संपादित करें और चलाएँ