शुरू करेंमुफ़्त में शुरू करें

विज़ुअलाइज़ेशन का उपयोग: lmplot

लिनियर मॉडल प्लॉट बनाना हमें यह देखने में मदद करता है कि वैरिएबल्स का dependent वैरिएबल के साथ संबंध है या नहीं. अगर है, तो वे हमारी एनालिसिस में शामिल करने के अच्छे उम्मीदवार हैं. अगर नहीं है, तो इसका मतलब यह नहीं कि उन्हें हटा दें; बल्कि हो सकता है कि उन्हें इस्तेमाल करने से पहले प्रोसेस या रैंगल करना पड़े.

seaborn आपके workspace में प्रचलित alias sns के साथ उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • लोड किए गए डेटा सेट df में से select() का उपयोग करके केवल 'SALESCLOSEPRICE' और 'LIVINGAREA' कॉलम चुनें.
  • sample() के साथ डेटा फ़्रेम का 50% सैंपल लें, ध्यान रखें कि replacement का उपयोग न हो और random seed 42 सेट करें.
  • Spark DataFrame को toPandas() के साथ pandas.DataFrame() में कन्वर्ट करें.
  • 'SALESCLOSEPRICE' को dependent वैरिएबल और 'LIVINGAREA' को independent के रूप में लेते हुए, seaborn के lmplot() से एक लिनियर मॉडल प्लॉट बनाएं.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Select a the relevant columns and sample
sample_df = df.____([____, ____]).____(____, ____, ____)

# Convert to pandas dataframe
pandas_df = sample_df.____()

# Linear model plot of pandas_df
sns.____(x=____, y=____, data=____)
plt.show()
कोड संपादित करें और चलाएँ