शुरू करेंमुफ़्त में शुरू करें

Distinct मान प्राप्त करना

कभी-कभी विश्लेषण में हर रिकॉर्ड की ज़रूरत नहीं होती, बल्कि एक या अधिक कॉलमों के यूनिक मान चाहिए होते हैं. डुप्लीकेट मानों को डेटा को dataframe में लोड करने के बाद हटाया जा सकता है, लेकिन यह इम्पोर्ट के समय भी SQL के DISTINCT कीवर्ड से किया जा सकता है.

क्योंकि hpd311calls में हाउसिंग इश्यूज़ का डेटा है, हम उम्मीद करेंगे कि ज़्यादातर रिकॉर्ड्स में borough दिया हो. आइए इस धारणा को यूनिक complaint_type/borough कॉम्बिनेशन क्वेरी करके परखते हैं.

pandas को pd के रूप में इम्पोर्ट किया गया है, और डेटाबेस इंजन engine बनाया जा चुका है.

Note: SQL चेकर कॉलम की पोज़िशन्स के बारे में काफ़ी सख्त है और अपेक्षा करता है कि फ़ील्ड्स को बताए गए क्रम में ही सेलेक्ट किया जाए.

यह अभ्यास पाठ्यक्रम का हिस्सा है

pandas के साथ सरल Data Ingestion

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ऐसी क्वेरी बनाएँ जो hpd311calls से borough और complaint_type (उसी क्रम में) के DISTINCT मान ले.
  • read_sql() का उपयोग करके क्वेरी के परिणामों को dataframe issues_and_boros में लोड करें.
  • dataframe प्रिंट करें ताकि यह जाँचा जा सके कि literature requests के अलावा बाकी सभी इश्यूज़ में borough सूचीबद्ध है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
कोड संपादित करें और चलाएँ