Distinct मान प्राप्त करना
कभी-कभी विश्लेषण में हर रिकॉर्ड की ज़रूरत नहीं होती, बल्कि एक या अधिक कॉलमों के यूनिक मान चाहिए होते हैं. डुप्लीकेट मानों को डेटा को dataframe में लोड करने के बाद हटाया जा सकता है, लेकिन यह इम्पोर्ट के समय भी SQL के DISTINCT कीवर्ड से किया जा सकता है.
क्योंकि hpd311calls में हाउसिंग इश्यूज़ का डेटा है, हम उम्मीद करेंगे कि ज़्यादातर रिकॉर्ड्स में borough दिया हो. आइए इस धारणा को यूनिक complaint_type/borough कॉम्बिनेशन क्वेरी करके परखते हैं.
pandas को pd के रूप में इम्पोर्ट किया गया है, और डेटाबेस इंजन engine बनाया जा चुका है.
Note: SQL चेकर कॉलम की पोज़िशन्स के बारे में काफ़ी सख्त है और अपेक्षा करता है कि फ़ील्ड्स को बताए गए क्रम में ही सेलेक्ट किया जाए.
यह अभ्यास पाठ्यक्रम का हिस्सा है
pandas के साथ सरल Data Ingestion
अभ्यास निर्देश
- ऐसी क्वेरी बनाएँ जो
hpd311callsसेboroughऔरcomplaint_type(उसी क्रम में) केDISTINCTमान ले. read_sql()का उपयोग करके क्वेरी के परिणामों को dataframeissues_and_borosमें लोड करें.- dataframe प्रिंट करें ताकि यह जाँचा जा सके कि literature requests के अलावा बाकी सभी इश्यूज़ में borough सूचीबद्ध है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)