CommencerCommencez gratuitement

Êtes-vous « requêtement » curieux ?

L'un des avantages de l'interface DataFrame est qu'elle vous permet d'exécuter des requêtes SQL sur les tables de votre cluster Spark. Si vous n'avez aucune expérience avec SQL, ne vous inquiétez pas, nous vous fournirons des requêtes. (Pour approfondir vos connaissances en SQL, veuillez commencer par notre cours Introduction au SQL.)

Comme vous l'avez observé dans le dernier exercice, l'une des tables de votre cluster est la table flights. Cette table contient une ligne pour chaque vol ayant décollé de l'aéroport international de Portland (PDX) ou de l'aéroport international de Seattle-Tacoma (SEA) en 2014 et 2015.

Pour exécuter une requête sur cette table, il suffit d'utiliser la méthode .sql() sur votre SparkSession. Cette méthode prend une chaîne contenant la requête et renvoie un DataFrame avec les résultats.

Si vous observez attentivement, vous remarquerez que la table flights n'est mentionnée que dans la requête, et non comme argument d'une des méthodes. En effet, aucun objet local dans votre environnement ne contient ces données, il ne serait donc pas pertinent de transmettre la table en tant qu'argument.

Veuillez noter que nous avons déjà créé un fichier SparkSession nommé spark dans votre espace de travail. (Il ne s'appelle plus my_spark, car nous l'avons créé pour vous !)

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Veuillez utiliser la méthode .sql() pour récupérer les 10 premières lignes de la table flights et enregistrer le résultat dans flights10. La variable query contient la requête SQL appropriée.
  • Veuillez utiliser la méthode DataFrame .show() pour afficher flights10.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Don't change this query
query = "FROM flights SELECT * LIMIT 10"

# Get the first 10 rows of flights
flights10 = ____

# Show the results
flights10.____
Modifier et exécuter le code