CommencezCommencez gratuitement

Partie 1 : Créer un DataFrame à partir d'un fichier CSV

Tous les quatre ans, les amateurs et amatrices de soccer partout dans le monde célèbrent la « Fifa World Cup » et, avec cet événement, bien des choses semblent changer dans plusieurs pays. Dans cet exercice en 3 parties, vous effectuerez une analyse exploratoire des données (EDA) sur l'ensemble « FIFA 2018 World Cup Player » à l'aide de PySpark SQL, en combinant des opérations sur des DataFrames, des requêtes SQL et de la visualisation.

Dans cette première partie, vous allez charger l'ensemble de joueurs de la FIFA 2018 (Fifa2018_dataset.csv), en format CSV, dans un DataFrame de PySpark et examiner les données à l'aide d'opérations de base sur les DataFrames.

Rappelez-vous que vous disposez déjà d'une SparkSession spark et d'une variable file_path dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez un DataFrame PySpark à partir de file_path (qui correspond au chemin du fichier Fifa2018_dataset.csv).
  • Affichez le schéma du DataFrame.
  • Affichez les 10 premières observations.
  • Combien de lignes y a-t-il dans le DataFrame?

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the Dataframe
fifa_df = spark.____(____, header=True, inferSchema=True)

# Check the schema of columns
fifa_df.____()

# Show the first 10 observations
fifa_df.____(____)

# Print the total number of rows
print("There are {} rows in the fifa_df DataFrame".format(fifa_df.____()))
Modifier et exécuter le code