शुरू करेंमुफ़्त में शुरू करें

सामान्य शब्द अनुक्रम खोजना

पहले आपने देखा था कि लंबाई तीन के शब्द अनुक्रम ("3-ट्यूपल") खोजने के लिए क्वेरी कैसे बनाते हैं. हमने उस क्वेरी को एक पारंपरिक SQL क्वेरी में सबक्वेरी के रूप में इस्तेमाल किया था, ताकि टेक्स्ट डॉक्यूमेंट में सबसे सामान्य 3-ट्यूपल मिल सकें. अब आप इसी तरह का काम करके सबसे सामान्य 5-ट्यूपल ढूँढेंगे.

DataFrame text_df उपलब्ध है. इसमें Sherlock Holmes के टेक्स्ट के पहले पाँच अध्याय हैं. इसके कॉलम हैं: word, id, part, title. id कॉलम एक integer है, ऐसा कि डॉक्यूमेंट में जो शब्द बाद में आता है उसका id उससे पहले आने वाले शब्द से बड़ा होता है. part कॉलम डेटा को अध्यायों में विभाजित करता है. DataFrame text_df को text नाम की अस्थायी टेबल के रूप में भी रजिस्टर किया गया है. हमारा उद्देश्य ऐसा डेटासेट बनाना है जहाँ हर पंक्ति एक 5-ट्यूपल को दर्शाए, और उसमें count यह बताए कि वह ट्यूपल डेटासेट में कितनी बार आया.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक क्वेरी query बनाइए जो डेटासेट में सबसे सामान्य 10 5-ट्यूपल ढूँढे.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Find the top 10 sequences of five words
query = """
SELECT w1, w2, w3, w4, w5, COUNT(*) AS count FROM (
   SELECT word AS w1,
   LEAD(____) OVER(____ ) AS w2,
   ____ AS w3,
   ____ AS w4,
   ____ AS w5
   FROM text
)
GROUP BY w1, w2, w3, w4, w5
ORDER BY count DESC, w1, w2, w3, w4, w5
LIMIT ____
"""
df = spark.sql(query)
df.show()
कोड संपादित करें और चलाएँ