Пайплайни Machine Learning
У наступних двох розділах ви послідовно пройдете кожен етап пайплайна машинного навчання — від завантаження даних до оцінювання моделі. Почнімо!
У центрі модуля pyspark.ml — класи Transformer і Estimator. Майже всі інші класи в модулі поводяться подібно до цих двох базових.
Класи Transformer мають метод .transform(), який приймає DataFrame і повертає новий DataFrame; зазвичай — вихідний із доданим новим стовпцем. Наприклад, можна використати клас Bucketizer, щоб розбити неперервну ознаку на дискретні інтервали (біни), або клас PCA, щоб зменшити розмірність набору даних за допомогою методу головних компонент.
Класи Estimator реалізують метод .fit(). Ці методи також приймають DataFrame, але замість повернення іншого DataFrame вони повертають об'єкт моделі. Це може бути, наприклад, StringIndexerModel для включення категоріальних даних, збережених як рядки, у ваші моделі, або RandomForestModel, що використовує алгоритм випадкового лісу для класифікації чи регресії.
Що з наведеного нижче є твердженням, яке не відповідає дійсності щодо машинного навчання в Spark?
Ця вправа є частиною курсу
Основи PySpark
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу