Partie 1 : Créer un DataFrame à partir d'un fichier CSV
Tous les quatre ans, les amateurs et amatrices de soccer partout dans le monde célèbrent la « Fifa World Cup » et, avec cet événement, bien des choses semblent changer dans plusieurs pays. Dans cet exercice en 3 parties, vous effectuerez une analyse exploratoire des données (EDA) sur l'ensemble « FIFA 2018 World Cup Player » à l'aide de PySpark SQL, en combinant des opérations sur des DataFrames, des requêtes SQL et de la visualisation.
Dans cette première partie, vous allez charger l'ensemble de joueurs de la FIFA 2018 (Fifa2018_dataset.csv), en format CSV, dans un DataFrame de PySpark et examiner les données à l'aide d'opérations de base sur les DataFrames.
Rappelez-vous que vous disposez déjà d'une SparkSession spark et d'une variable file_path dans votre espace de travail.
Cette activité fait partie du cours
Principes de Big Data avec PySpark
Instructions de l’exercice
- Créez un DataFrame PySpark à partir de
file_path(qui correspond au chemin du fichierFifa2018_dataset.csv). - Affichez le schéma du DataFrame.
- Affichez les 10 premières observations.
- Combien de lignes y a-t-il dans le DataFrame?
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)
# Check the schema of columns
fifa_df.____()
# Show the first 10 observations
fifa_df.____(____)
# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))