शुरू करेंमुफ़्त में शुरू करें

Multicollinearity से बचना

वापस हमारे sales डेटासेट salesData पर, जो workspace में पहले से लोड है. इसके अलावा, rms पैकेज भी लोड है.

चलिए एक multiple linear regression का अनुमान लगाते हैं! स्वाभाविक रूप से, हम डेटासेट में उपलब्ध सभी वैरिएबल्स का उपयोग करना चाहते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Marketing Analytics के लिए Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • आगे बढ़िए और इस महीने की sales को explain करने के लिए id को छोड़कर सभी वैरिएबल्स का इस्तेमाल करते हुए salesModel1 नाम का full मॉडल बनाइए. ऐसा करने के लिए, नीचे दिए गए डमी सिंटैक्स में सही वैरिएबल नाम भरें: response ~ . - excluded_variable. इसे ऐसे पढ़ा जा सकता है: "response सभी वैरिएबल्स से मॉडल किया गया है, सिवाय excluded_variable के."
  • rms पैकेज के vif() फंक्शन से variance inflation factors का अनुमान लगाइए.
  • id वैरिएबल को exclude करने के अलावा, multicollinearity से बचने के लिए preferredBrand और nBrands वैरिएबल्स को भी हटाइए. ऐसा करने के लिए, फ़ॉर्मूला में प्रत्येक को - के साथ जोड़ें. मॉडल को salesModel2 नाम के ऑब्जेक्ट में सहेजें.
  • मॉडल के variance inflation factors को दोबारा निकालिए. क्या अब आप परिणामों को स्वीकार करेंगे?

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Estimating the full model
salesModel1 <- lm(salesThisMon ~ . - ___, 
                 data = salesData)

# Checking variance inflation factors
vif(___)

# Estimating new model by removing information on brand
salesModel2 <- lm(salesThisMon ~ . - ___, 
                 data = ___)

# Checking variance inflation factors
___
कोड संपादित करें और चलाएँ