Pipelines de machine learning
Dans les deux chapitres suivants, vous passerez en revue toutes les étapes du processus de machine learning, de la collecte des données à l'évaluation des modèles. Passons à l’action !
Au cœur du module pyspark.ml se trouvent les classes Transformer et Estimator. Presque toutes les autres classes du module se comportent de manière similaire à ces deux classes de base.
Les classes Transformer disposent d'une méthode .transform() qui prend un DataFrame et renvoie un nouveau DataFrame, généralement l'original avec une nouvelle colonne ajoutée. Par exemple, vous pouvez utiliser la classe Bucketizer pour créer des classes distinctes à partir d'une caractéristique continue ou la classe PCA pour réduire la dimensionnalité de votre ensemble de données à l'aide de l'analyse en composantes principales.
Toutes les classes Estimator implémentent une méthode .fit(). Ces méthodes utilisent également un DataFrame, mais au lieu de renvoyer un autre DataFrame, elles renvoient un objet modèle. Il peut s'agir d'un modèle de classification (StringIndexerModel) pour inclure des données catégorielles enregistrées sous forme de chaînes dans vos modèles, ou d'un modèle de régression (RandomForestModel) qui utilise l'algorithme de forêt aléatoire pour la classification ou la régression.
Parmi les affirmations suivantes, laquelle n'est pas vraie concernant le machine learning dans Spark ?
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Exercice interactif pratique
Transformez la théorie en action avec l’un de nos exercices interactifs
Commencer l’exercice