Skapa särdrag och mål
Vi är nästan framme – våra särdrag och mål är snart redo för maskininlärning. Vi har särdrag från aktuella prisförändringar (5d_close_pct) och indikatorer (glidande medelvärden och RSI), och vi har skapat mål i form av framtida prisförändringar (5d_close_future_pct). Nu behöver vi dela upp dessa i separata numpy-arrayer så att vi kan mata in dem i maskininlärningsalgoritmer.
Våra indikatorer medför också att det saknas värden i början av DataFrame:en, på grund av hur beräkningarna fungerar. Vi kan fylla i dessa bakåt, ersätta dem med ett fast värde, eller ta bort raderna. Att ta bort raderna är ett bra val – då undviker vi att maskininlärningsalgoritmerna påverkas av bakåtfylld data eller nollor. Pandas har en .dropna()-funktion som vi använder för att ta bort alla rader med saknade värden.
Den här övningen är en del av kursen
Maskininlärning för finans i Python
Övningsinstruktioner
- Ta bort saknade värden från
lng_dfmed.dropna()från pandas. - Skapa en variabel som innehåller våra mål, det vill säga värdena för
'5d_close_future_pct'. - Skapa en DataFrame som innehåller både mål (
5d_close_future_pct) och särdrag (de som finns i den befintliga listanfeature_names), så att vi kan kontrollera korrelationerna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Drop all na values
lng_df = lng_df.____
# Create features and targets
# use feature_names for features; '5d_close_future_pct' for targets
features = lng_df[feature_names]
targets = lng_df[____]
# Create DataFrame from target column and feature columns
feature_and_target_cols = ['5d_close_future_pct'] + ____
feat_targ_df = lng_df[feature_and_target_cols]
# Calculate correlation matrix
corr = feat_targ_df.corr()
print(corr)