Se passer de l'intermédiaire
Vous savez maintenant comment charger des données dans Spark via pandas, mais vous vous demandez sans doute pourquoi utiliser pandas dans ce cas ? Ne serait-il pas plus simple de lire un fichier texte directement dans Spark ? Bien sûr que oui !
Heureusement, votre SparkSession possède un attribut .read avec plusieurs méthodes pour lire différentes sources de données dans des DataFrames Spark. Grâce à celles-ci, vous pouvez créer un DataFrame à partir d'un fichier .csv comme vous le feriez avec un DataFrame pandas classique !
La variable file_path est une chaîne de caractères contenant le chemin vers le fichier airports.csv. Ce fichier renferme de l'information sur divers aéroports partout dans le monde.
Une SparkSession nommée spark est disponible dans votre espace de travail.
Cette activité fait partie du cours
Fondements de PySpark
Instructions de l’exercice
- Utilisez la méthode
.read.csv()pour créer un DataFrame Spark appeléairports.- Le premier argument est
file_path. - Passez l'argument
header=Truepour indiquer à Spark de prendre les noms de colonnes à partir de la première ligne du fichier.
- Le premier argument est
- Affichez ce DataFrame en appelant
.show().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()