CommencerCommencez gratuitement

Utilisation de Spark dans Python

La première étape pour utiliser Spark consiste à se connecter à un cluster.

En pratique, le cluster est hébergé sur une machine distante connectée à tous les autres nœuds. Il y a un ordinateur, appelé master, qui gère la répartition des données et les calculs. Le master est connecté aux autres ordinateurs du cluster, appelés « workers ». Le master transmet aux workers les données et les calculs à exécuter, et ceux-ci renvoient leurs résultats au master.

Lorsque vous débutez avec Spark, il est plus simple d'exécuter un cluster localement. Par conséquent, pour ce cours, au lieu de se connecter à un autre ordinateur, tous les calculs seront effectués sur les serveurs de DataCamp dans un cluster simulé.

La création de la connexion est aussi simple que la création d'une instance de la classe SparkContext. Le constructeur de classe accepte quelques arguments facultatifs qui vous permettent de spécifier les attributs du cluster auquel vous vous connectez.

Un objet contenant tous ces attributs peut être créé à l'aide du constructeur SparkConf(). Veuillez consulter la documentation pour obtenir tous les détails.

Pour la suite de ce cours, vous disposerez d'un fichier SparkContext nommé sc déjà disponible dans votre espace de travail.

Comment se connecter à un cluster Spark à partir de PySpark ?

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Exercice interactif pratique

Transformez la théorie en action avec l’un de nos exercices interactifs

Commencer l’exercice