विज़ुअलाइज़ेशन का उपयोग: lmplot
लिनियर मॉडल प्लॉट बनाना हमें यह देखने में मदद करता है कि वैरिएबल्स का dependent वैरिएबल के साथ संबंध है या नहीं. अगर है, तो वे हमारी एनालिसिस में शामिल करने के अच्छे उम्मीदवार हैं. अगर नहीं है, तो इसका मतलब यह नहीं कि उन्हें हटा दें; बल्कि हो सकता है कि उन्हें इस्तेमाल करने से पहले प्रोसेस या रैंगल करना पड़े.
seaborn आपके workspace में प्रचलित alias sns के साथ उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
- लोड किए गए डेटा सेट
dfमें सेselect()का उपयोग करके केवल 'SALESCLOSEPRICE' और 'LIVINGAREA' कॉलम चुनें. sample()के साथ डेटा फ़्रेम का 50% सैंपल लें, ध्यान रखें कि replacement का उपयोग न हो और random seed 42 सेट करें.- Spark DataFrame को
toPandas()के साथpandas.DataFrame()में कन्वर्ट करें. - 'SALESCLOSEPRICE' को dependent वैरिएबल और 'LIVINGAREA' को independent के रूप में लेते हुए, seaborn के
lmplot()से एक लिनियर मॉडल प्लॉट बनाएं.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)
# Convert to pandas dataframe
pandas_df = sample_df.____()
# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()