Řešení neúplných duplicit
Dataset parking_violation byl upraven tak, aby obsahoval sloupec fee s výší pokuty za přestupek. Tento sloupec by se hodil pro sledování příjmů z parkovacích pokut v New Yorku. Jenže kvůli duplicitním záznamům o přestupcích by výpočty příjmů z tohoto datasetu nebyly přesné. Tyto duplicitní záznamy se liší pouze hodnotou ve sloupci fee – ostatní hodnoty mají shodné. Bylo rozhodnuto, že k vyřešení nejednoznačnosti způsobené duplicitami se použije nejnižší hodnota fee.
Identifikuj 3 duplicitní záznamy v parking_violation a pomocí funkce MIN() zjisti, jaká hodnota fee bude použita po odstranění duplicit.
Toto cvičení je součástí kurzu
Cleaning Data in PostgreSQL Databases
Pokyny k cvičení
- Vrať
summons_numbera minimální hodnotufeepro duplicitní záznamy. - Výsledky seskup podle
summons_number. - Omez výsledky na záznamy, jejichž počet výskytů
summons_numberje větší než 1.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
SELECT
-- Include SELECT list columns
___,
___(___) AS fee
FROM
parking_violation
GROUP BY
-- Define column for GROUP BY
___
HAVING
-- Restrict to summons numbers with count greater than 1
___(___) ___ ___;