शुरू करेंमुफ़्त में शुरू करें

डीपर फीचर्स

पिछले अभ्यासों में हमने दिखाया था कि दो फीचर्स को जोड़ने से एक प्रेडिक्टिव मॉडल के लिए अच्छे अतिरिक्त फीचर्स बन सकते हैं। इस अभ्यास में, आप तीन वैरिएबल्स के प्रभावों को एक में मिलाकर 'डीपर' फीचर्स जनरेट करेंगे। फिर आप जाँचेंगे कि क्या डीपर और ज्यादा जटिल फीचर्स हमेशा बेहतर प्रेडिक्टर्स बनते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • SQFTBELOWGROUND और SQFTABOVEGROUND को जोड़कर एक नया फीचर बनाएँ और उसे एक नए कॉलम Total_SQFT में रखें
  • Total_SQFT का उपयोग करके BATHSTOTAL के साथ एक और फीचर बनाएँ, जिसका नाम BATHS_PER_1000SQFT हो. ध्यान रखें कि Total_SQFT को 1000 की स्केल पर स्केल करें
  • हमारे नए फीचर BATHS_PER_1000SQFT के नए min, max और mean को जाँचने के लिए describe() का उपयोग करें. कुछ अजीब दिख रहा है?
  • दो jointplots() बनाएँ जिनमें Total_SQFT और BATHS_PER_1000SQFT को \(x\) मान और SALESCLOSEPRICE को \(y\) मान रखें, ताकि देखें किसका R**2 फिट बेहतर है. क्या यह ज्यादा जटिल फीचर SALESCLOSEPRICE के साथ अधिक मजबूत संबंध दिखाता है?

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create new feature by adding two features together
df = df.____(____, df[____] + df[____])

# Create additional new feature using previously created feature
df = df.____(____, df[____] / (df[____] / ____))
df[[____]].____().show()

# Sample and create pandas dataframe
pandas_df = df.sample(False, 0.5, 0).toPandas()

# Linear model plots
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
sns.jointplot(x=____, y=____, data=pandas_df, kind="reg", stat_func=r2)
plt.show()
कोड संपादित करें और चलाएँ