Envie de requêtes?
L'un des avantages de l'interface DataFrame, c'est que vous pouvez exécuter des requêtes SQL sur les tables de votre grappe Spark. Si vous n'avez jamais touché à SQL, ne vous en faites pas, nous vous fournirons les requêtes! (Pour en apprendre davantage sur SQL, commencez par notre cours Introduction to SQL.)
Comme vous l'avez vu dans le dernier exercice, l'une des tables de votre grappe est la table flights. Cette table contient une ligne pour chaque vol parti de l'aéroport international de Portland (PDX) ou de l'aéroport international Seattle-Tacoma (SEA) en 2014 et 2015.
Exécuter une requête sur cette table est aussi simple que d'utiliser la méthode .sql() sur votre SparkSession. Cette méthode prend une chaîne de caractères contenant la requête et retourne un DataFrame avec les résultats!
Si vous regardez de près, vous remarquerez que la table flights n'est mentionnée que dans la requête, et non comme argument d'une méthode. C'est parce qu'il n'existe pas d'objet local dans votre environnement qui contient ces données; il ne serait donc pas logique de passer la table en argument.
Rappelez-vous, nous avons déjà créé une SparkSession appelée spark dans votre espace de travail. (Ce n'est plus my_spark parce que nous l'avons créée pour vous!)
Cette activité fait partie du cours
Fondements de PySpark
Instructions de l’exercice
- Utilisez la méthode
.sql()pour obtenir les 10 premières lignes de la tableflightset enregistrez le résultat dansflights10. La variablequerycontient la requête SQL appropriée. - Utilisez la méthode DataFrame
.show()pour afficherflights10.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Don't change this query
query = "FROM flights SELECT * LIMIT 10"
# Get the first 10 rows of flights
flights10 = ____
# Show the results
flights10.____