आंशिक डुप्लीकेट्स का समाधान
parking_violation डेटासेट में अब fee कॉलम जोड़ा गया है, जो उल्लंघन की फीस दिखाता है. यह कॉलम New York City की पार्किंग टिकट से होने वाली आमदनी को ट्रैक करने में काम आएगा. लेकिन डुप्लीकेट उल्लंघन रिकॉर्ड्स की वजह से, इस डेटासेट पर आधारित रेवेन्यू कैलकुलेशन सटीक नहीं होंगे. ये डुप्लीकेट रिकॉर्ड्स सिर्फ fee कॉलम के मान में भिन्न हैं. बाकी सभी कॉलम मान डुप्लीकेट रिकॉर्ड्स में समान हैं. यह तय किया गया है कि इन डुप्लीकेट्स से बनी अस्पष्टता को दूर करने के लिए न्यूनतम fee का उपयोग किया जाएगा.
3 डुप्लीकेट parking_violation रिकॉर्ड्स पहचानिए और डुप्लीकेट रिकॉर्ड्स हटाने के बाद उपयोग की जाने वाली fee निर्धारित करने के लिए MIN() फंक्शन का उपयोग कीजिए.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PostgreSQL डेटाबेस में डेटा क्लीनिंग
अभ्यास निर्देश
- डुप्लीकेट रिकॉर्ड्स के लिए
summons_numberऔर न्यूनतमfeeरिटर्न करें. - परिणामों को
summons_numberके आधार पर ग्रुप करें. - परिणामों को उन्हीं रिकॉर्ड्स तक सीमित करें जिनके
summons_numberका count 1 से अधिक है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
SELECT
-- Include SELECT list columns
___,
___(___) AS fee
FROM
parking_violation
GROUP BY
-- Define column for GROUP BY
___
HAVING
-- Restrict to summons numbers with count greater than 1
___(___) ___ ___;