Začněte nyníZačněte zdarma

Prozkoumej data pomocí EDA

Nejdřív se podíváme na data zblízka. Kdykoli začínáme projekt strojového učení, je potřeba nejprve provést průzkumnou analýzu dat (EDA), abychom se s daty dobře seznámili. Patří sem například:

  • grafy surových dat
  • histogramy
  • a další…

Já obvykle začínám právě grafy surových dat a histogramy. Díky nim pochopíme rozložení dat. Pokud jde o normální rozdělení, můžeme využít parametrické statistické metody.

Do pandas DataFramů jsou pro tebe načteny dva akciové tituly: lng_df a spy_df (LNG a SPY). Prohlédni si je pomocí .head(). Jako vstupy pro algoritmy strojového učení budeme používat závěrečné ceny a postupně i objemy obchodů.

Poznámka: Pokaždé, když chceme vytvořit nový graf, zavoláme plt.clf() nebo f = plt.figure().

Toto cvičení je součástí kurzu

Machine Learning for Finance in Python

Zobrazit kurz

Pokyny k cvičení

  • Vypiš prvních 5 řádků obou DataFramů (lng_df a spy_df) a prohlédni si jejich obsah.
  • Pomocí pandas vykresli grafy časových řad surových dat pro 'SPY' a 'LNG' s upravenou závěrečnou cenou ('Adj_Close') – v .plot() nastav legend=True.
  • Pomocí plt.show() zobraz graf časové řady (matplotlib.pyplot je naimportován jako plt).
  • Pomocí pandas a matplotlib vytvoř histogram procentuální změny upravené závěrečné ceny za 1 den (použij .pct_change()) pro SPY a LNG.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

print(lng_df.head())  # examine the DataFrames
print(____)  # examine the SPY DataFrame

# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____  # show the plot
plt.clf()  # clear the plot space

# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()
Upravit a spustit kód