Prozkoumej data pomocí EDA
Nejdřív se podíváme na data zblízka. Kdykoli začínáme projekt strojového učení, je potřeba nejprve provést průzkumnou analýzu dat (EDA), abychom se s daty dobře seznámili. Patří sem například:
- grafy surových dat
- histogramy
- a další…
Já obvykle začínám právě grafy surových dat a histogramy. Díky nim pochopíme rozložení dat. Pokud jde o normální rozdělení, můžeme využít parametrické statistické metody.
Do pandas DataFramů jsou pro tebe načteny dva akciové tituly: lng_df a spy_df (LNG a SPY). Prohlédni si je pomocí .head(). Jako vstupy pro algoritmy strojového učení budeme používat závěrečné ceny a postupně i objemy obchodů.
Poznámka: Pokaždé, když chceme vytvořit nový graf, zavoláme plt.clf() nebo f = plt.figure().
Toto cvičení je součástí kurzu
Machine Learning for Finance in Python
Pokyny k cvičení
- Vypiš prvních 5 řádků obou DataFramů (
lng_dfaspy_df) a prohlédni si jejich obsah. - Pomocí pandas vykresli grafy časových řad surových dat pro
'SPY'a'LNG's upravenou závěrečnou cenou ('Adj_Close') – v.plot()nastavlegend=True. - Pomocí
plt.show()zobraz graf časové řady (matplotlib.pyplotje naimportován jakoplt). - Pomocí pandas a matplotlib vytvoř histogram procentuální změny upravené závěrečné ceny za 1 den (použij
.pct_change()) pro SPY a LNG.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()