Charger un fichier CSV dans un DataFrame
Dans l'exercice précédent, vous avez vu une méthode pour créer un DataFrame à partir d'un RDD. En général, charger des données à partir d'un fichier CSV est la façon la plus courante de créer des DataFrames. Dans cet exercice, vous allez créer un DataFrame PySpark à partir du fichier people.csv qui vous est déjà fourni sous forme de file_path, puis confirmer que l'objet créé est bien un DataFrame PySpark.
Rappelez-vous que vous avez déjà une SparkSession spark et une variable file_path (le chemin vers le fichier people.csv) disponibles dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Créez un DataFrame à partir de la variable
file_path, qui correspond au chemin du fichierpeople.csv. - Confirmez que le résultat est un DataFrame PySpark.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))