解决不完全重复记录
已对 parking_violation 数据集进行了修改,新增了 fee 列用于表示违规罚款金额。该列有助于统计纽约市停车罚单的收入。然而,由于存在重复的违规记录,基于该数据集计算的收入将不准确。这些重复记录仅在 fee 列的取值上不同,其他列的取值在重复记录间完全相同。为消除这些重复带来的歧义,已决定使用最小的 fee 值作为标准。
请找出 3 条重复的 parking_violation 记录,并使用 MIN() 函数确定在去重后将采用的 fee 值。
本练习是课程的一部分
在 PostgreSQL 数据库中清理数据
练习说明
- 返回重复记录的
summons_number以及对应的最小fee。 - 按
summons_number分组结果。 - 将结果限定为
summons_number的记录数(count)大于 1 的情况。
交互式实操练习
通过完成这段示例代码来试试这个练习。
SELECT
-- Include SELECT list columns
___,
___(___) AS fee
FROM
parking_violation
GROUP BY
-- Define column for GROUP BY
___
HAVING
-- Restrict to summons numbers with count greater than 1
___(___) ___ ___;