SOUNDEX() के साथ नामों की तुलना
गड़बड़ स्ट्रिंग्स, जैसे 'Illinois' की जगह 'Ilynois', डेटा का विश्लेषण करते समय दिक्कतें पैदा कर सकती हैं। इसलिए इन्हें पहचानना ज़रूरी है।
flight_statistics टेबल का विश्लेषण करते समय, आप देखते हैं कि कुछ statistician_name और statistician_surname अलग तरह से लिखे गए हैं, जैसे Miriam Smith और Myriam Smyth। आपको लगता है कि ऐसी और भी भिन्नताएँ हो सकती हैं, इसलिए आप इन सभी नामों की जाँच करना चाहते हैं।
आप आँकड़ाशास्त्रियों के नामों की तुलना SOUNDEX() से करने के बारे में सोचते हैं। अगर SOUNDEX() का परिणाम एक जैसा आता है, लेकिन जिन टेक्स्ट्स की आप तुलना कर रहे हैं वे अलग हैं, तो आपको वह डेटा मिल जाएगा जिसे आपको क्लीन करना है।
यह अभ्यास पाठ्यक्रम का हिस्सा है
SQL Server डेटाबेस में डेटा क्लीनिंग
अभ्यास निर्देश
S1सेstatistician_nameऔरstatistician_surnameकॉलम्स के विशिष्ट (distinct) मान चुनें।- समान ध्वनि वाले first name और surname को मिलाने के लिए
SOUNDEX()का उपयोग करते हुएflight_statisticsटेबल कोS2के रूप में INNER JOIN करें। - वे मान फ़िल्टर करें जहाँ
S1औरS2में क्रमशःstatistician_nameऔरstatistician_surnameएक-दूसरे से अलग हों।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
SELECT
-- First name and surname of the statisticians
DISTINCT S1.___, S1.___
-- Join flight_statistics with itself
FROM ___ S1 INNER JOIN ___ S2
-- The SOUNDEX result of the first name and surname have to be the same
ON ___(S1.___) = ___(S2.___)
AND ___(S1.___) = ___(S2.___)
-- The texts of the first name or the texts of the surname have to be different
WHERE S1.___ <> S2.___
OR S1.___ <> S2.___