CommencezCommencez gratuitement

Pipelines de Machine Learning

Dans les deux prochains chapitres, vous parcourrez toutes les étapes d'un pipeline de machine learning, de l'ingestion des données jusqu'à l'évaluation du modèle. Allons-y!

Au cœur du module pyspark.ml se trouvent les classes Transformer et Estimator. Presque toutes les autres classes du module se comportent de façon similaire à ces deux classes de base.

Les classes Transformer possèdent une méthode .transform() qui prend un DataFrame et retourne un nouveau DataFrame; généralement l'original avec une nouvelle colonne ajoutée. Par exemple, vous pourriez utiliser la classe Bucketizer pour créer des intervalles discrets à partir d'une variable continue, ou la classe PCA pour réduire la dimensionnalité de votre jeu de données à l'aide de l'analyse en composantes principales.

Les classes Estimator implémentent toutes une méthode .fit(). Ces méthodes prennent aussi un DataFrame, mais au lieu de retourner un autre DataFrame, elles retournent un objet modèle. Cela peut être, par exemple, un StringIndexerModel pour intégrer des données catégorielles enregistrées sous forme de chaînes de caractères à vos modèles, ou un RandomForestModel qui utilise l'algorithme de forêts aléatoires pour la classification ou la régression.

Laquelle des affirmations suivantes n'est pas vraie au sujet du machine learning dans Spark?

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Exercice interactif pratique

Passez de la théorie à l’action grâce à l’un de nos exercices interactifs

Commencer l’exercice