शुरू करेंमुफ़्त में शुरू करें

कॉन्टेक्स्ट विंडो फीचर डेटा बनाना

मूविंग विंडो तकनीक उन मशीन लर्निंग मॉडल्स के लिए उपयोगी है जो कॉन्टेक्स्ट विंडो फीचर डेटा का उपयोग करते हैं.

आपके वर्कस्पेस में एक टेबल text उपलब्ध है, जिसमें कॉलम id, word, part, title हैं. इसमें Sherlock Holmes पुस्तक के अध्याय 9, 10, 11 और 12 शामिल हैं. शब्द पहले से प्रोसेस किए गए हैं और प्रति पंक्ति एक शब्द के रूप में व्यवस्थित हैं. हर शब्द का एक यूनिक पूर्णांक इंडेक्स कॉलम id में दिया गया है. जो शब्द टेक्स्ट में पहले आते हैं, उनके लिए id छोटा होता है, और जो बाद में आते हैं, उनके लिए id बड़ा होता है.

अध्याय 12 के डेटासेट की पहली 10 पंक्तियाँ कंसोल में Table1 के रूप में प्रिंट की गई हैं. इच्छित परिणाम की पहली दस पंक्तियाँ, जिन्हें केवल भाग 12 (अध्याय 12) दिखाने तक सीमित किया गया है, कंसोल में Table2 के रूप में प्रिंट की गई हैं. Table2 में, प्रत्येक पंक्ति का "given" शब्द कॉलम w3 में है. कॉलम w1 और w2 दिए गए शब्द से तुरंत पहले के दो शब्द देते हैं. कॉलम w4 और w5 दिए गए शब्द के तुरंत बाद के दो शब्द देते हैं.

ध्यान दें कि पहली पंक्ति में w1 और w2 null हैं. ऐसा इसलिए है क्योंकि भाग 12 के भीतर w3 (यहाँ, "xii") से पहले कोई शब्द नहीं है.

अगर आप वीडियो में कोई चरण भूल जाएँ, तो कंसोल के दाईं ओर उपलब्ध स्लाइड्स देखने में हिचकिचाएँ नहीं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Spark SQL परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • प्रत्येक पंक्ति के लिए उस शब्द को लाइए, साथ ही उससे पहले के दो शब्द और उसके बाद के दो शब्द भी लाइए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Word for each row, previous two and subsequent two words
query = """
SELECT
part,
LAG(word, 2) OVER(PARTITION BY ____ ORDER BY ____) AS w1,
LAG(word, ____) OVER(____ BY part ____ BY id) AS w2,
word AS w3,
____(word, 1) OVER(____ BY part ____ BY id) AS w4,
LEAD(word, 2) OVER(____ BY part ____ BY id) AS w5
FROM text
"""
spark.sql(query).where("part = 12").show(10)
कोड संपादित करें और चलाएँ