НачатьНачать бесплатно

Пайплайны машинного обучения

В следующих двух главах вы пройдёте все этапы пайплайна машинного обучения — от загрузки данных до оценки модели. Начнём!

В основе модуля pyspark.ml лежат классы Transformer и Estimator. Почти все остальные классы модуля работают по схожему принципу.

Классы Transformer реализуют метод .transform(), который принимает DataFrame и возвращает новый DataFrame — как правило, исходный с добавленным столбцом. Например, класс Bucketizer позволяет разбить непрерывный признак на дискретные интервалы, а класс PCA — уменьшить размерность набора данных с помощью метода главных компонент.

Классы Estimator реализуют метод .fit(). Эти методы также принимают DataFrame, однако вместо нового DataFrame возвращают объект модели. Это может быть, например, StringIndexerModel для работы с категориальными данными, сохранёнными в виде строк, или RandomForestModel, использующий алгоритм случайного леса для классификации или регрессии.

Какое из следующих утверждений о машинном обучении в Spark неверно?

Это упражнение является частью курса

Основы PySpark

Посмотреть курс

Практическое интерактивное упражнение

Превратите теорию в практику с помощью одного из наших интерактивных упражнений

Начать упражнение