Suppression des intermédiaires
Vous savez désormais comment intégrer des données dans Spark via pandas, mais vous vous demandez probablement pourquoi utiliser pandas ? Ne serait-il pas plus simple de lire directement un fichier texte dans Spark ? Bien sûr que oui !
Heureusement, votre SparkSession dispose d'un attribut .read qui propose plusieurs méthodes permettant de lire différentes sources de données dans des Spark DataFrames. Grâce à ces éléments, vous pouvez créer un DataFrame à partir d'un fichier .csv, tout comme avec les DataFrames classiques pandas.
La variable file_path est une chaîne contenant le chemin d'accès au fichier airports.csv. Ce fichier contient des informations sur différents aéroports à travers le monde.
Un SparkSession nommé spark est disponible dans votre espace de travail.
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Instructions de l’exercice
Utilisez la méthode
.read.csv()pour créer un Spark DataFrame appeléairportsLe premier argument est
file_pathVeuillez transmettre l'argument
header=Trueafin que Spark sache qu'il doit récupérer les noms de colonnes à partir de la première ligne du fichier.
Veuillez afficher ce DataFrame en appelant l
.show().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()