Multicollinearity से बचना
वापस हमारे sales डेटासेट salesData पर, जो workspace में पहले से लोड है. इसके अलावा, rms पैकेज भी लोड है.
चलिए एक multiple linear regression का अनुमान लगाते हैं! स्वाभाविक रूप से, हम डेटासेट में उपलब्ध सभी वैरिएबल्स का उपयोग करना चाहते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Marketing Analytics के लिए Machine Learning
अभ्यास निर्देश
- आगे बढ़िए और इस महीने की sales को explain करने के लिए
idको छोड़कर सभी वैरिएबल्स का इस्तेमाल करते हुएsalesModel1नाम का full मॉडल बनाइए. ऐसा करने के लिए, नीचे दिए गए डमी सिंटैक्स में सही वैरिएबल नाम भरें:response ~ . - excluded_variable. इसे ऐसे पढ़ा जा सकता है: "responseसभी वैरिएबल्स से मॉडल किया गया है, सिवायexcluded_variableके." rmsपैकेज केvif()फंक्शन से variance inflation factors का अनुमान लगाइए.idवैरिएबल को exclude करने के अलावा, multicollinearity से बचने के लिएpreferredBrandऔरnBrandsवैरिएबल्स को भी हटाइए. ऐसा करने के लिए, फ़ॉर्मूला में प्रत्येक को-के साथ जोड़ें. मॉडल कोsalesModel2नाम के ऑब्जेक्ट में सहेजें.- मॉडल के variance inflation factors को दोबारा निकालिए. क्या अब आप परिणामों को स्वीकार करेंगे?
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Estimating the full model
salesModel1 <- lm(salesThisMon ~ . - ___,
data = salesData)
# Checking variance inflation factors
vif(___)
# Estimating new model by removing information on brand
salesModel2 <- lm(salesThisMon ~ . - ___,
data = ___)
# Checking variance inflation factors
___