EDA के साथ डेटा को एक्सप्लोर करें
सबसे पहले, आइए डेटा को एक्सप्लोर करें। जब भी हम कोई मशीन लर्निंग (ML) प्रोजेक्ट शुरू करते हैं, तो डेटा से परिचित होने के लिए हमें सबसे पहले exploratory data analysis (EDA) करना होता है। इसमें शामिल हो सकता है:
- रॉ डेटा प्लॉट्स
- हिस्टोग्राम्स
- और भी बहुत कुछ…
मैं आमतौर पर रॉ डेटा प्लॉट्स और हिस्टोग्राम्स से शुरू करता/करती हूँ। इससे हमें अपने डेटा के डिस्ट्रीब्यूशंस समझने में मदद मिलती है। अगर यह नॉर्मल डिस्ट्रीब्यूशन है, तो हम पैरामेट्रिक स्टैटिस्टिक्स जैसी चीज़ों का उपयोग कर सकते हैं।
आपके लिए दो स्टॉक्स pandas DataFrames में लोड किए गए हैं: lng_df और spy_df (LNG और SPY)। इन्हें .head() से देखिए। हम क्लोज़िंग प्राइस और आगे चलकर वॉल्यूम को ML एल्गोरिदम्स के इनपुट्स के रूप में उपयोग करेंगे।
नोट: जब भी हमें नया प्लॉट बनाना होगा, हम plt.clf() या f = plt.figure() कॉल करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Finance के लिए Machine Learning
अभ्यास निर्देश
- दोनों DataFrame (
lng_dfऔरspy_df) की पहली 5 पंक्तियाँ प्रिंट करें और उनकी सामग्री जाँचें। - pandas लाइब्रेरी का उपयोग करके
'SPY'और'LNG'के adjusted close प्राइस ('Adj_Close') का रॉ टाइम सीरीज़ डेटा प्लॉट करें —.plot()मेंlegend=Trueसेट करें। - रॉ टाइम सीरीज़ प्लॉट दिखाने के लिए
plt.show()का उपयोग करें (matplotlib.pyplotकोpltके रूप में इम्पोर्ट किया गया है)। - SPY और LNG के adjusted close के 1-day प्रतिशत डिफरेंस (
.pct_change()का उपयोग करें) का हिस्टोग्राम बनाने के लिए pandas और matplotlib का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()