不完全な重複の解消
parking_violation データセットに、違反に対する手数料を示す fee 列が追加されています。これは、New York City の駐車違反チケット収入を把握するのに役立ちます。しかし、違反記録に重複があるため、このデータセットに基づく収益計算は正確ではありません。これらの重複レコードは fee 列の値だけが異なり、他の列の値はすべて同一です。重複によるあいまいさを解消するため、最小の fee を採用することに決めました。
重複している parking_violation レコードを3件特定し、MIN() 関数を使って、重複レコードの削除後に使用する fee を求めてください。
この演習はコースの一部です
PostgreSQLデータベースで学ぶデータクレンジング
演習の手順
- 重複レコードに対して、
summons_numberと最小のfeeを返します。 - 結果は
summons_numberでグループ化します。 summons_numberの件数(count)が1より大きいレコードのみに結果を制限します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
SELECT
-- Include SELECT list columns
___,
___(___) AS fee
FROM
parking_violation
GROUP BY
-- Define column for GROUP BY
___
HAVING
-- Restrict to summons numbers with count greater than 1
___(___) ___ ___;