CommencezCommencez gratuitement

Envie de requêtes?

L'un des avantages de l'interface DataFrame, c'est que vous pouvez exécuter des requêtes SQL sur les tables de votre grappe Spark. Si vous n'avez jamais touché à SQL, ne vous en faites pas, nous vous fournirons les requêtes! (Pour en apprendre davantage sur SQL, commencez par notre cours Introduction to SQL.)

Comme vous l'avez vu dans le dernier exercice, l'une des tables de votre grappe est la table flights. Cette table contient une ligne pour chaque vol parti de l'aéroport international de Portland (PDX) ou de l'aéroport international Seattle-Tacoma (SEA) en 2014 et 2015.

Exécuter une requête sur cette table est aussi simple que d'utiliser la méthode .sql() sur votre SparkSession. Cette méthode prend une chaîne de caractères contenant la requête et retourne un DataFrame avec les résultats!

Si vous regardez de près, vous remarquerez que la table flights n'est mentionnée que dans la requête, et non comme argument d'une méthode. C'est parce qu'il n'existe pas d'objet local dans votre environnement qui contient ces données; il ne serait donc pas logique de passer la table en argument.

Rappelez-vous, nous avons déjà créé une SparkSession appelée spark dans votre espace de travail. (Ce n'est plus my_spark parce que nous l'avons créée pour vous!)

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Instructions de l’exercice

  • Utilisez la méthode .sql() pour obtenir les 10 premières lignes de la table flights et enregistrez le résultat dans flights10. La variable query contient la requête SQL appropriée.
  • Utilisez la méthode DataFrame .show() pour afficher flights10.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Don't change this query
query = "FROM flights SELECT * LIMIT 10"

# Get the first 10 rows of flights
flights10 = ____

# Show the results
flights10.____
Modifier et exécuter le code