Récupérer des valeurs distinctes
Parfois, une analyse n'a pas besoin de chaque enregistrement, mais plutôt des valeurs uniques d'une ou de plusieurs colonnes. On peut retirer les doublons après avoir chargé les données dans un dataframe, mais on peut aussi le faire à l'importation avec le mot-clé SQL DISTINCT.
Comme hpd311calls contient des données sur des problèmes de logement, on s'attendrait à ce que la plupart des enregistrements aient un arrondissement indiqué. Vérifions cette hypothèse en interrogeant les combinaisons uniques de complaint_type/borough.
pandas a été importé sous le nom pd, et le moteur de base de données a été créé sous le nom engine.
Remarque : Le vérificateur SQL est très pointilleux sur la position des colonnes et s'attend à ce que les champs soient sélectionnés dans l'ordre spécifié.
Cette activité fait partie du cours
Ingestion de données rationalisée avec pandas
Instructions de l’exercice
- Créez une requête qui récupère les valeurs
DISTINCTpourboroughetcomplaint_type(dans cet ordre) à partir dehpd311calls. - Utilisez
read_sql()pour charger les résultats de la requête dans un dataframe,issues_and_boros. - Imprimez le dataframe pour vérifier l'hypothèse selon laquelle toutes les demandes, sauf celles de littérature, apparaissent avec un arrondissement indiqué.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)