CommencerCommencez gratuitement

Qu'est-ce que Spark, au juste ?

Spark est une plateforme destinée au Cluster Computing (Grappe de calcul). Spark vous permet de répartir les données et les calculs sur des clusters comportant plusieurs nœuds (considérez chaque nœud comme un ordinateur distinct). Le fractionnement de vos données facilite le traitement de très grands ensembles de données, car chaque nœud ne traite qu'une petite quantité de données.

Comme chaque nœud traite son propre sous-ensemble de données, il effectue également une partie des calculs totaux requis, de sorte que le traitement des données et les calculs sont effectués en parallèle sur les nœuds du cluster. Il est avéré que le calcul parallèle peut accélérer considérablement certains types de tâches de programmation.

Cependant, une puissance de calcul accrue s'accompagne d'une plus grande complexité.

Déterminer si Spark est la solution la plus appropriée pour votre problème nécessite une certaine expérience, mais vous pouvez vous poser les questions suivantes :

  • Mes données sont-elles trop volumineuses pour être traitées sur une seule machine ?
  • Mes calculs peuvent-ils être facilement parallélisés ?

Souhaitez-vous en savoir plus sur Spark ?

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Exercice interactif pratique

Transformez la théorie en action avec l’un de nos exercices interactifs

Commencer l’exercice