CommencezCommencez gratuitement

Utiliser les DataFrames

La structure de données centrale de Spark est le Resilient Distributed Dataset (RDD). Il s'agit d'un objet de bas niveau qui permet à Spark de faire sa magie en répartissant les données sur plusieurs nœuds du grappe. Cependant, les RDD sont difficiles à utiliser directement, donc dans ce cours vous utiliserez l'abstraction Spark DataFrame construite au-dessus des RDD.

Le Spark DataFrame a été conçu pour se comporter un peu comme une table SQL (une table avec des variables en colonnes et des observations en lignes). En plus d'être plus faciles à comprendre, les DataFrames sont également mieux optimisés que les RDD pour les opérations complexes.

Lorsque vous commencez à modifier et à combiner des colonnes et des lignes de données, il existe de nombreuses façons d'arriver au même résultat, mais certaines prennent souvent beaucoup plus de temps que d'autres. Avec les RDD, c'est au ou à la data scientist de trouver la bonne façon d'optimiser la requête, mais l'implémentation des DataFrames intègre déjà une bonne partie de cette optimisation !

Pour commencer à travailler avec les Spark DataFrames, vous devez d'abord créer un objet SparkSession à partir de votre SparkContext. Vous pouvez considérer le SparkContext comme votre connexion au grappe et le SparkSession comme votre interface avec cette connexion.

Rappelez-vous que pour le reste de ce cours, vous aurez un SparkSession nommé spark disponible dans votre environnement de travail !

Laquelle des options suivantes est un avantage des Spark DataFrames par rapport aux RDD ?

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Exercice interactif pratique

Passez de la théorie à l’action grâce à l’un de nos exercices interactifs

Commencer l’exercice