Features और targets बनाएँ
हमारे पास features और targets लगभग मशीन लर्निंग के लिए तैयार हैं — हमारे पास current price changes (5d_close_pct) और indicators (moving averages और RSI) से features हैं, और हमने future price changes (5d_close_future_pct) के targets बनाए हैं। अब हमें इन्हें अलग-अलग numpy arrays में बाँटना है ताकि हम इन्हें मशीन लर्निंग एल्गोरिदम्स में दे सकें।
हमारे indicators की गणनाओं के कारण DataFrame की शुरुआत में missing values भी आती हैं। हम इस डेटा को backfill कर सकते हैं, किसी एक value से भर सकते हैं, या उन rows को हटा सकते हैं। Rows को हटाना एक अच्छा विकल्प है ताकि हमारे मशीन लर्निंग एल्गोरिदम्स backfilled या 0-filled डेटा से भ्रमित न हों। Pandas में .dropna() फंक्शन होता है, जिसका उपयोग हम किसी भी missing values वाली rows को हटाने के लिए करेंगे।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Finance के लिए Machine Learning
अभ्यास निर्देश
- pandas का
.dropna()इस्तेमाल करकेlng_dfसे missing values हटा दें। - हमारे targets वाला एक वैरिएबल बनाइए, जो
'5d_close_future_pct'values हैं। - एक DataFrame बनाइए जिसमें targets (
5d_close_future_pct) और features (जो मौजूदा listfeature_namesमें हैं) दोनों शामिल हों, ताकि हम correlations जाँच सकें।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Drop all na values
lng_df = lng_df.____
# Create features and targets
# use feature_names for features; '5d_close_future_pct' for targets
features = lng_df[feature_names]
targets = lng_df[____]
# Create DataFrame from target column and feature columns
feature_and_target_cols = ['5d_close_future_pct'] + ____
feat_targ_df = lng_df[feature_and_target_cols]
# Calculate correlation matrix
corr = feat_targ_df.corr()
print(corr)