CommencezCommencez gratuitement

Résoudre des doublons partiels

Le jeu de données parking_violation a été modifié pour inclure une colonne fee indiquant les frais liés à l'infraction. Cette colonne est utile pour suivre les revenus liés aux contraventions de stationnement de la ville de New York. Toutefois, en raison de dossiers d'infraction dupliqués, les calculs de revenus fondés sur ce jeu de données ne seraient pas exacts. Ces enregistrements en double ne diffèrent que par la valeur de la colonne fee. Toutes les autres colonnes sont identiques dans les doublons. Il a été décidé d'utiliser la valeur minimale de fee pour lever l'ambiguïté créée par ces doublons.

Repérez les 3 enregistrements parking_violation dupliqués et utilisez la fonction MIN() pour déterminer la valeur de fee qui sera retenue après la suppression des doublons.

Cette activité fait partie du cours

Nettoyer des données dans des bases de données PostgreSQL

Voir le cours

Instructions de l’exercice

  • Retournez le summons_number et la valeur minimale de fee pour les enregistrements dupliqués.
  • Regroupez les résultats par summons_number.
  • Limitez les résultats aux enregistrements dont le count de summons_number est supérieur à 1.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

SELECT 
	-- Include SELECT list columns
	___, 
    ___(___) AS fee
FROM 
	parking_violation 
GROUP BY
	-- Define column for GROUP BY
	___ 
HAVING 
	-- Restrict to summons numbers with count greater than 1
	___(___) ___ ___;
Modifier et exécuter le code