Rozwiązywanie niejednoznacznych duplikatów
Zbiór danych parking_violation został zmodyfikowany o kolumnę fee, która wskazuje wysokość opłaty za dane naruszenie. Kolumna ta przydaje się do śledzenia przychodów z mandatów parkingowych w Nowym Jorku. Jednak z powodu zduplikowanych rekordów naruszenia obliczenia przychodów na podstawie tego zbioru danych byłyby niedokładne. Duplikaty różnią się wyłącznie wartością w kolumnie fee – wszystkie pozostałe wartości kolumn są identyczne. Zdecydowano, że do rozwiązania niejednoznaczności wynikającej z duplikatów zostanie użyta minimalna wartość fee.
Zidentyfikuj 3 zduplikowane rekordy w tabeli parking_violation i użyj funkcji MIN(), aby ustalić wartość fee, która zostanie zastosowana po usunięciu duplikatów.
To ćwiczenie jest częścią kursu
Czyszczenie danych w bazach PostgreSQL
Instrukcje do ćwiczenia
- Zwróć kolumnę
summons_numberoraz minimalną wartośćfeedla zduplikowanych rekordów. - Pogrupuj wyniki według kolumny
summons_number. - Ogranicz wyniki do rekordów, których liczba wystąpień
summons_numberjest większa niż 1.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
SELECT
-- Include SELECT list columns
___,
___(___) AS fee
FROM
parking_violation
GROUP BY
-- Define column for GROUP BY
___
HAVING
-- Restrict to summons numbers with count greater than 1
___(___) ___ ___;