始める無料で始める

不完全な重複の解消

parking_violation データセットに、違反に対する手数料を示す fee 列が追加されています。これは、New York City の駐車違反チケット収入を把握するのに役立ちます。しかし、違反記録に重複があるため、このデータセットに基づく収益計算は正確ではありません。これらの重複レコードは fee 列の値だけが異なり、他の列の値はすべて同一です。重複によるあいまいさを解消するため、最小の fee を採用することに決めました。

重複している parking_violation レコードを3件特定し、MIN() 関数を使って、重複レコードの削除後に使用する fee を求めてください。

この演習はコースの一部です

PostgreSQLデータベースで学ぶデータクレンジング

コースを見る

演習の手順

  • 重複レコードに対して、summons_number と最小の fee を返します。
  • 結果は summons_number でグループ化します。
  • summons_number の件数(count)が1より大きいレコードのみに結果を制限します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

SELECT 
	-- Include SELECT list columns
	___, 
    ___(___) AS fee
FROM 
	parking_violation 
GROUP BY
	-- Define column for GROUP BY
	___ 
HAVING 
	-- Restrict to summons numbers with count greater than 1
	___(___) ___ ___;
コードを編集して実行