Utiliser Spark en Python
La première étape pour utiliser Spark consiste à se connecter à une grappe.
En pratique, la grappe est hébergée sur une machine distante qui est reliée à tous les autres nœuds. Un ordinateur, appelé le maître, gère le découpage des données et des calculs. Le maître est connecté au reste des ordinateurs de la grappe, appelés travailleurs. Le maître envoie aux travailleurs les données et les calculs à exécuter, et ils renvoient leurs résultats au maître.
Quand vous débutez avec Spark, il est plus simple d'exécuter une grappe localement. Ainsi, dans ce cours, plutôt que de vous connecter à un autre ordinateur, tous les calculs seront exécutés sur les serveurs de DataCamp dans une grappe simulée.
Créer la connexion revient simplement à instancier la classe SparkContext. Le constructeur de la classe accepte quelques arguments facultatifs qui vous permettent de préciser les attributs de la grappe à laquelle vous vous connectez.
On peut créer un objet qui regroupe tous ces attributs avec le constructeur SparkConf(). Consultez la documentation pour tous les détails !
Pour le reste de ce cours, vous aurez déjà un SparkContext nommé sc disponible dans votre espace de travail.
Comment vous connectez-vous à une grappe Spark à partir de PySpark ?
Cette activité fait partie du cours
Fondements de PySpark
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice