शुरू करेंमुफ़्त में शुरू करें

ID फ़ील्ड जोड़ना

डेटा के साथ काम करते समय, कई बार आप केवल कुछ खास फ़ील्ड्स तक पहुँचना चाहते हैं और उन पर अलग-अलग ऑपरेशंस करना चाहते हैं. इस अभ्यास में, DataFrame से सभी यूनिक वोटर नाम ढूँढिए और एक यूनिक ID नंबर जोड़िए. याद रखिए कि Spark IDs DataFrame की partition के आधार पर असाइन होती हैं — इसलिए ID वैल्यूज़ DataFrame की वास्तविक रो संख्या से कहीं ज़्यादा हो सकती हैं.

Spark की lazy प्रोसेसिंग के कारण, IDs तब तक वास्तव में जनरेट नहीं होतीं जब तक कोई एक्शन न चलाया जाए, और डेटासेट के आकार के अनुसार वे कुछ हद तक रैंडम भी लग सकती हैं.

spark सेशन और एक Spark DataFrame df जिसमें DallasCouncilVotes.csv.gz फ़ाइल है, आपके वर्कस्पेस में उपलब्ध हैं. pyspark.sql.functions लाइब्रेरी F उपनाम के साथ उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • कॉलम VOTER NAME से यूनिक एंट्रीज़ चुनकर voter_df नाम का नया DataFrame बनाएँ.
  • voter_df DataFrame में रो की गिनती करें.
  • उपयुक्त Spark फंक्शन का उपयोग करके एक ROW_ID कॉलम जोड़ें.
  • सबसे बड़े 10 ROW_ID वाली रो दिखाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Select all the unique council voters
voter_df = df.____(df["VOTER NAME"]).____()

# Count the rows in voter_df
print("\nThere are %d rows in the voter_df DataFrame.\n" % ____)

# Add a ROW_ID
voter_df = voter_df.____('ROW_ID', F.____())

# Show the rows with 10 highest IDs in the set
voter_df.orderBy(voter_df.____.desc()).show(____)
कोड संपादित करें और चलाएँ