CommencezCommencez gratuitement

Se passer de l'intermédiaire

Vous savez maintenant comment charger des données dans Spark via pandas, mais vous vous demandez sans doute pourquoi utiliser pandas dans ce cas ? Ne serait-il pas plus simple de lire un fichier texte directement dans Spark ? Bien sûr que oui !

Heureusement, votre SparkSession possède un attribut .read avec plusieurs méthodes pour lire différentes sources de données dans des DataFrames Spark. Grâce à celles-ci, vous pouvez créer un DataFrame à partir d'un fichier .csv comme vous le feriez avec un DataFrame pandas classique !

La variable file_path est une chaîne de caractères contenant le chemin vers le fichier airports.csv. Ce fichier renferme de l'information sur divers aéroports partout dans le monde.

Une SparkSession nommée spark est disponible dans votre espace de travail.

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Instructions de l’exercice

  • Utilisez la méthode .read.csv() pour créer un DataFrame Spark appelé airports.
    • Le premier argument est file_path.
    • Passez l'argument header=True pour indiquer à Spark de prendre les noms de colonnes à partir de la première ligne du fichier.
  • Affichez ce DataFrame en appelant .show().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Modifier et exécuter le code