CommencerCommencez gratuitement

Utilisation des DataFrames

La structure de données principale de Spark est le Resilient Distributed Dataset (RDD). Il s'agit d'un objet de bas niveau qui permet à Spark d'opérer sa magie en répartissant les données sur plusieurs nœuds du cluster. Cependant, les RDD sont difficiles à manipuler directement. Par conséquent, dans ce cours, vous utiliserez l'abstraction Spark DataFrame construite sur les RDD.

Le Spark DataFrame a été conçu pour se comporter de manière similaire à une table SQL (une table avec des variables dans les colonnes et des observations dans les lignes). Non seulement Les DataFrames sont plus faciles à comprendre, mais ils sont également plus optimisés pour les opérations complexes que les RDD.

Lorsque vous commencez à modifier et à combiner des colonnes et des lignes de données, il existe plusieurs méthodes pour obtenir le même résultat, mais certaines prennent souvent beaucoup plus de temps que d'autres. Lors de l'utilisation des RDD, il incombe au data scientist de déterminer la manière appropriée d'optimiser la requête, mais l'implémentation du DataFrame intègre déjà une grande partie de cette optimisation.

Pour commencer à utiliser des Spark DataFrames, il est nécessaire de créer un objet SparkSession à partir de votre SparkContext. Vous pouvez considérer SparkContext comme votre connexion au cluster et SparkSession comme votre interface avec cette connexion.

Veuillez noter que pour la suite de ce cours, vous disposerez d'un SparkSession appelé spark, disponible dans votre espace de travail.

Parmi les éléments suivants, lequel constitue un avantage des Spark DataFrames par rapport aux RDD ?

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Exercice interactif pratique

Transformez la théorie en action avec l’un de nos exercices interactifs

Commencer l’exercice