Analytique avec SQL sur des DataFrames
Les requêtes SQL sont concises et faciles à exécuter comparativement aux opérations sur les DataFrames. Toutefois, pour pouvoir appliquer des requêtes SQL sur un DataFrame, vous devez d'abord créer une vue temporaire du DataFrame comme table, puis appliquer les requêtes SQL sur la table créée.
Vous avez déjà un SparkContext spark et salaries_df disponibles dans votre espace de travail.
Cette activité fait partie du cours
Introduction à PySpark
Instructions de l’exercice
- Créez la table temporaire
"salaries_table"à partir du DataFramesalaries_df. - Construisez une requête pour extraire la colonne "job_title" où
company_locationest le Canada ("CA"). - Appliquez la requête SQL et créez un nouveau DataFrame
canada_titles. - Obtenez un résumé de la table.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a temporary view of salaries_table
salaries_df.____('salaries_table')
# Construct the "query"
query = '''SELECT job_title, salary_in_usd FROM ____ WHERE company_location == "CA"'''
# Apply the SQL "query"
canada_titles = spark.____(____)
# Generate basic statistics
canada_titles.____().show()