ПочатиПочніть безкоштовно

Уникнення мультиколінеарності

Повернімося до нашого набору даних продажів salesData, який уже завантажено в робочий простір. Додатково завантажено пакет rms.

Оцінимо множинну лінійну регресію! Звісно, ми хочемо використати всі змінні, що є в наборі даних.

Ця вправа є частиною курсу

Machine Learning для маркетингової аналітики в R

Переглянути курс

Інструкції до вправи

  • Обчисліть повну модель під назвою salesModel1, використавши всі змінні, окрім id, щоб пояснити продажі цього місяця. Для цього підставте правильні назви змінних у таку шаблонну форму: response ~ . - excluded_variable. Це читається як «response моделюється всіма змінними, крім excluded_variable».
  • Оцініть коефіцієнти інфляції дисперсії за допомогою функції vif() з пакета rms.
  • Крім виключення змінної id, приберіть змінні preferredBrand і nBrands, щоб уникнути мультиколінеарності. Зробіть це, додавши для кожної з них -. Збережіть модель в об'єкті salesModel2.
  • Переоцініть коефіцієнти інфляції дисперсії для моделі. Чи прийняли б ви тепер результати?

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Estimating the full model
salesModel1 <- lm(salesThisMon ~ . - ___, 
                 data = salesData)

# Checking variance inflation factors
vif(___)

# Estimating new model by removing information on brand
salesModel2 <- lm(salesThisMon ~ . - ___, 
                 data = ___)

# Checking variance inflation factors
___
Редагувати та запускати код