다중공선성 피하기
작업 공간에는 이미 판매 데이터셋 salesData가 로드되어 있으며, rms 패키지도 불러와져 있어요.
이제 다중 선형 회귀모형을 추정해 보겠습니다! 물론, 데이터셋에 있는 모든 변수를 활용하고자 합니다.
이 연습은 강의의 일부입니다
R로 배우는 Machine Learning 기반 마케팅 분석
연습 안내
- 이번 달 매출을 설명하기 위해
id를 제외한 모든 변수를 사용하는 전체 모형을salesModel1이라는 이름으로 계산하세요. 이를 위해 다음 더미 구문에 올바른 변수명을 채워 넣으세요:response ~ . - excluded_variable. 이는 "response를excluded_variable을 제외한 모든 변수로 모형화한다"는 뜻입니다. rms패키지의vif()함수를 사용해 분산 팽창 계수를 추정하세요.- 다중공선성을 피하기 위해
id변수에 더해preferredBrand와nBrands변수도 제외하세요. 각 변수를-로 덧붙여 제거할 수 있습니다. 이렇게 만든 모형을salesModel2라는 객체에 저장하세요. - 해당 모형의 분산 팽창 계수를 다시 추정하세요. 이제는 결과를 수용할 만한가요?
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Estimating the full model
salesModel1 <- lm(salesThisMon ~ . - ___,
data = salesData)
# Checking variance inflation factors
vif(___)
# Estimating new model by removing information on brand
salesModel2 <- lm(salesThisMon ~ . - ___,
data = ___)
# Checking variance inflation factors
___