CommencezCommencez gratuitement

Analytique avec SQL sur des DataFrames

Les requêtes SQL sont concises et faciles à exécuter comparativement aux opérations sur les DataFrames. Toutefois, pour pouvoir appliquer des requêtes SQL sur un DataFrame, vous devez d'abord créer une vue temporaire du DataFrame comme table, puis appliquer les requêtes SQL sur la table créée.

Vous avez déjà un SparkContext spark et salaries_df disponibles dans votre espace de travail.

Cette activité fait partie du cours

Introduction à PySpark

Voir le cours

Instructions de l’exercice

  • Créez la table temporaire "salaries_table" à partir du DataFrame salaries_df.
  • Construisez une requête pour extraire la colonne "job_title" où company_location est le Canada ("CA").
  • Appliquez la requête SQL et créez un nouveau DataFrame canada_titles.
  • Obtenez un résumé de la table.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a temporary view of salaries_table
salaries_df.____('salaries_table')

# Construct the "query"
query = '''SELECT job_title, salary_in_usd FROM ____ WHERE company_location == "CA"'''

# Apply the SQL "query"
canada_titles = spark.____(____)

# Generate basic statistics
canada_titles.____().show()
Modifier et exécuter le code