or
Это упражнение является частью курса
В этой главе мы рассмотрим понятие регрессии с точки зрения машинного обучения и познакомимся с основным методом — линейной регрессией. Вы узнаете, как построить модель линейной регрессии и использовать её для получения прогнозов.
Теперь, когда вы освоили основы линейной регрессии, пришло время научиться оценивать качество моделей. Мы рассмотрим графические методы оценки и две ключевые метрики для регрессионных моделей. Вы также узнаете, как строить модели, которые хорошо работают на новых данных, а не только на обучающей выборке. Все эти концепции применимы к любым регрессионным алгоритмам, хотя демонстрировать их мы будем на примере линейной регрессии.
Текущее упражнение
Прежде чем перейти к более сложным методам регрессии, мы рассмотрим ряд важных аспектов моделирования: работу с категориальными переменными, взаимодействия между переменными, а также случаи, когда стоит преобразовывать входные данные и целевую переменную перед построением модели. Хотя более продвинутые методы частично решают эти задачи автоматически, важно понимать их суть — чтобы выбирать подходящие алгоритмы и знать, какие проблемы по-прежнему требуют ручной обработки.
Освоив линейные модели, мы перейдём к методам, предназначенным для ситуаций, в которых предположение о линейности не выполняется. Речь пойдёт о предсказании вероятностей и частот (значения от 0 до 1), счётных величин (неотрицательные целые числа и соответствующие показатели), а также о зависимостях, которые являются аддитивными, но нелинейными. Все рассматриваемые алгоритмы представляют собой обобщения стандартной линейной модели.
В этой главе мы рассмотрим алгоритмы моделирования, которые не предполагают линейности или аддитивности и способны улавливать ограниченные типы взаимодействий между входными переменными. Это *методы на основе деревьев*, которые работают путём объединения ансамблей *деревьев решений*, построенных на обучающих данных.