Aan de slagBegin gratis

Verken de data met wat EDA

Laten we eerst de data verkennen. Telkens als we aan een Machine Learning (ML)-project beginnen, doen we eerst wat exploratieve data-analyse (EDA) om vertrouwd te raken met de data. Dit omvat dingen zoals:

  • ruwe dataplots
  • histogrammen
  • en meer…

Ik begin meestal met ruwe dataplots en histogrammen. Zo krijgen we inzicht in de verdelingen van onze data. Als het een normale verdeling is, kunnen we parametische statistiek gebruiken.

Er zijn twee aandelen voor je ingeladen in pandas DataFrames: lng_df en spy_df (LNG en SPY). Bekijk ze met .head(). We gebruiken de slotkoersen en later ook het volume als input voor ML-algoritmen.

Let op: we roepen plt.clf() aan telkens wanneer we een nieuwe plot willen maken, of f = plt.figure().

Deze oefening maakt deel uit van de cursus

Machine Learning voor finance in Python

Bekijk cursus

Oefeninstructies

  • Print de eerste 5 regels van de twee DataFrames (lng_df en spy_df) en bekijk de inhoud.
  • Gebruik de pandas-bibliotheek om ruwe tijdreeksdata te plotten voor 'SPY' en 'LNG' met de aangepaste slotkoers ('Adj_Close') — zet legend=True in .plot().
  • Gebruik plt.show() om de ruwe tijdreeksplot te tonen (matplotlib.pyplot is geïmporteerd als plt).
  • Gebruik pandas en matplotlib om een histogram te maken van het eendaagse procentuele verschil van de aangepaste slotkoers (gebruik .pct_change()) voor SPY en LNG.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

print(lng_df.head())  # examine the DataFrames
print(____)  # examine the SPY DataFrame

# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____  # show the plot
plt.clf()  # clear the plot space

# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()
Code bewerken en uitvoeren