CommencerCommencez gratuitement

Suppression des intermédiaires

Vous savez désormais comment intégrer des données dans Spark via pandas, mais vous vous demandez probablement pourquoi utiliser pandas ? Ne serait-il pas plus simple de lire directement un fichier texte dans Spark ? Bien sûr que oui !

Heureusement, votre SparkSession dispose d'un attribut .read qui propose plusieurs méthodes permettant de lire différentes sources de données dans des Spark DataFrames. Grâce à ces éléments, vous pouvez créer un DataFrame à partir d'un fichier .csv, tout comme avec les DataFrames classiques pandas.

La variable file_path est une chaîne contenant le chemin d'accès au fichier airports.csv. Ce fichier contient des informations sur différents aéroports à travers le monde.

Un SparkSession nommé spark est disponible dans votre espace de travail.

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez la méthode .read.csv() pour créer un Spark DataFrame appelé airports

    • Le premier argument est file_path

    • Veuillez transmettre l'argument header=True afin que Spark sache qu'il doit récupérer les noms de colonnes à partir de la première ligne du fichier.

  • Veuillez afficher ce DataFrame en appelant l.show().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Modifier et exécuter le code