CommencezCommencez gratuitement

Récupérer des valeurs distinctes

Parfois, une analyse n'a pas besoin de chaque enregistrement, mais plutôt des valeurs uniques d'une ou de plusieurs colonnes. On peut retirer les doublons après avoir chargé les données dans un dataframe, mais on peut aussi le faire à l'importation avec le mot-clé SQL DISTINCT.

Comme hpd311calls contient des données sur des problèmes de logement, on s'attendrait à ce que la plupart des enregistrements aient un arrondissement indiqué. Vérifions cette hypothèse en interrogeant les combinaisons uniques de complaint_type/borough.

pandas a été importé sous le nom pd, et le moteur de base de données a été créé sous le nom engine.

Remarque : Le vérificateur SQL est très pointilleux sur la position des colonnes et s'attend à ce que les champs soient sélectionnés dans l'ordre spécifié.

Cette activité fait partie du cours

Ingestion de données rationalisée avec pandas

Voir le cours

Instructions de l’exercice

  • Créez une requête qui récupère les valeurs DISTINCT pour borough et complaint_type (dans cet ordre) à partir de hpd311calls.
  • Utilisez read_sql() pour charger les résultats de la requête dans un dataframe, issues_and_boros.
  • Imprimez le dataframe pour vérifier l'hypothèse selon laquelle toutes les demandes, sauf celles de littérature, apparaissent avec un arrondissement indiqué.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
Modifier et exécuter le code