Пайплайны машинного обучения
В следующих двух главах вы пройдёте все этапы пайплайна машинного обучения — от загрузки данных до оценки модели. Начнём!
В основе модуля pyspark.ml лежат классы Transformer и Estimator. Почти все остальные классы модуля работают по схожему принципу.
Классы Transformer реализуют метод .transform(), который принимает DataFrame и возвращает новый DataFrame — как правило, исходный с добавленным столбцом. Например, класс Bucketizer позволяет разбить непрерывный признак на дискретные интервалы, а класс PCA — уменьшить размерность набора данных с помощью метода главных компонент.
Классы Estimator реализуют метод .fit(). Эти методы также принимают DataFrame, однако вместо нового DataFrame возвращают объект модели. Это может быть, например, StringIndexerModel для работы с категориальными данными, сохранёнными в виде строк, или RandomForestModel, использующий алгоритм случайного леса для классификации или регрессии.
Какое из следующих утверждений о машинном обучении в Spark неверно?
Это упражнение является частью курса
Основы PySpark
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение