CommencezCommencez gratuitement

Partie 2 : Requêtes SQL sur un DataFrame

Le DataFrame fifa_df que nous avons créé contient des renseignements supplémentaires sur les types de données et les noms de colonnes qui y sont associés. Ces renseignements supplémentaires permettent à PySpark SQL d'exécuter des requêtes SQL sur un DataFrame. Les requêtes SQL sont concises et plus faciles à exécuter que les opérations sur DataFrame. Toutefois, pour pouvoir appliquer des requêtes SQL à un DataFrame, vous devez d'abord créer une vue temporaire du DataFrame sous forme de table, puis exécuter des requêtes SQL sur la table créée (Exécuter des requêtes SQL par programmation).

Dans cette deuxième partie, vous allez créer une table temporaire à partir du DataFrame fifa_df et exécuter des requêtes SQL pour extraire la colonne « Age » des joueurs provenant d'Allemagne.

Vous disposez déjà d'un SparkContext spark et de fifa_df dans votre espace de travail.

Cette activité fait partie du cours

Principes de Big Data avec PySpark

Voir le cours

Instructions de l’exercice

  • Créez la table temporaire fifa_df_table à partir du DataFrame fifa_df.
  • Rédigez une « requête » pour extraire la colonne « Age » des joueurs allemands dans fifa_df_table.
  • Appliquez la « requête » SQL et créez un nouveau DataFrame fifa_df_germany_age.
  • Calculez les statistiques de base du DataFrame créé.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a temporary view of fifa_df
fifa_df.____('fifa_df_table')

# Construct the "query"
query = '''SELECT ____ FROM ____ WHERE Nationality == "Germany"'''

# Apply the SQL "query"
fifa_df_germany_age = spark.____(____)

# Generate basic statistics
fifa_df_germany_age.____().show()
Modifier et exécuter le code