Utforska data med EDA
Låt oss börja med att utforska data. Inför varje maskininlärningsprojekt (ML) behöver vi först göra en explorativ dataanalys (EDA) för att bekanta oss med datan. Det innebär bland annat:
- diagram över rådata
- histogram
- och mycket mer…
Jag brukar börja med diagram över rådata och histogram. Det ger oss en bild av datans fördelningar. Är det en normalfördelning kan vi använda exempelvis parametrisk statistik.
Två aktier har laddats in i pandas DataFrames åt dig: lng_df och spy_df (LNG och SPY). Ta en titt på dem med .head(). Vi kommer att använda stängningskurser och så småningom volym som indata till ML-algoritmerna.
Obs: Vi anropar plt.clf() varje gång vi vill skapa ett nytt diagram, eller använder f = plt.figure().
Den här övningen är en del av kursen
Maskininlärning för finans i Python
Övningsinstruktioner
- Skriv ut de första 5 raderna i de två DataFrames (
lng_dfochspy_df) och undersök deras innehåll. - Använd pandas-biblioteket för att rita råa tidsseriedata för
'SPY'och'LNG'med det justerade stängningspriset ('Adj_Close') -- angelegend=Truei.plot(). - Använd
plt.show()för att visa tidsserieplottet (matplotlib.pyplothar importerats somplt). - Använd pandas och matplotlib för att skapa ett histogram över den justerade stängningskursens procentuella förändring per dag (använd
.pct_change()) för SPY och LNG.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()