解決不完整的重複資料
parking_violation 資料集已新增一個 fee 欄位,用來表示違規的罰費。這個欄位可用來追蹤紐約市停車罰單的收入。不過,因為存在重複的違規紀錄,若直接用這個資料集計算收入,結果會不精確。這些重複紀錄之間只在 fee 欄位的值不同,其他欄位的值都相同。為了消除這些重複造成的歧義,已決定採用最小的 fee 作為準則。
請找出 3 筆重複的 parking_violation 紀錄,並使用 MIN() 函式決定在移除重複紀錄後要採用的 fee。
本練習屬於課程
清理 PostgreSQL 資料庫中的資料
練習說明
- 回傳重複紀錄的
summons_number與最小的fee。 - 以
summons_number分組結果。 - 僅保留
summons_number的筆數(count)大於 1 的紀錄。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
SELECT
-- Include SELECT list columns
___,
___(___) AS fee
FROM
parking_violation
GROUP BY
-- Define column for GROUP BY
___
HAVING
-- Restrict to summons numbers with count greater than 1
___(___) ___ ___;