CommencezCommencez gratuitement

Charger un fichier CSV dans un DataFrame

Dans l'exercice précédent, vous avez vu une méthode pour créer un DataFrame à partir d'un RDD. En général, charger des données à partir d'un fichier CSV est la façon la plus courante de créer des DataFrames. Dans cet exercice, vous allez créer un DataFrame PySpark à partir du fichier people.csv qui vous est déjà fourni sous forme de file_path, puis confirmer que l'objet créé est bien un DataFrame PySpark.

Rappelez-vous que vous avez déjà une SparkSession spark et une variable file_path (le chemin vers le fichier people.csv) disponibles dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez un DataFrame à partir de la variable file_path, qui correspond au chemin du fichier people.csv.
  • Confirmez que le résultat est un DataFrame PySpark.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
Modifier et exécuter le code