or
Это упражнение является частью курса
Spark — это фреймворк для работы с большими данными. В этой главе вы познакомитесь с основами Spark и машинного обучения, узнаете, как подключиться к Spark с помощью Python и загрузить данные в формате CSV.
Освоив загрузку данных в Spark, вы перейдёте к построению двух типов моделей классификации: дерева решений и логистической регрессии. Также вы изучите несколько подходов к подготовке данных.
Далее вы научитесь строить модели линейной регрессии. Вы узнаете, как расширить набор данных за счёт конструирования новых признаков, а также освоите надёжный подход к отбору наиболее значимых из них.
Текущее упражнение
В заключительной главе вы узнаете, как повысить эффективность моделей. Вы научитесь использовать конвейеры, чтобы сделать код более понятным и удобным в сопровождении. Затем освоите кросс-валидацию для более качественного тестирования моделей и подбора оптимальных параметров. В финале познакомитесь с двумя типами ансамблевых моделей.