Eksploracja danych (EDA)
Zacznijmy od eksploracji danych. Na początku każdego projektu uczenia maszynowego (ML) warto przeprowadzić eksploracyjną analizę danych (EDA), aby dobrze poznać zbiór, z którym pracujemy. Obejmuje to m.in.:
- wykresy surowych danych
- histogramy
- i wiele innych…
Zazwyczaj zaczyna się od wykresów surowych danych i histogramów – pozwalają one zrozumieć rozkłady danych. Jeśli dane mają rozkład normalny, można stosować metody statystyki parametrycznej.
Do pandas DataFrames wczytano dwa zbiory danych: lng_df i spy_df (LNG i SPY). Przejrzyj je za pomocą .head(). Ceny zamknięcia, a z czasem także wolumen, posłużą jako dane wejściowe do algorytmów ML.
Uwaga: za każdym razem, gdy chcesz utworzyć nowy wykres, wywołaj plt.clf() lub f = plt.figure().
To ćwiczenie jest częścią kursu
Uczenie maszynowe w finansach z Pythonem
Instrukcje do ćwiczenia
- Wyświetl pierwsze 5 wierszy obu DataFrames (
lng_dfispy_df) i zapoznaj się z ich zawartością. - Użyj biblioteki pandas, aby narysować wykresy surowych szeregów czasowych dla
'SPY'i'LNG'z użyciem ceny zamknięcia po korekcie ('Adj_Close') – ustawlegend=Truew.plot(). - Użyj
plt.show(), aby wyświetlić wykres szeregu czasowego (bibliotekamatplotlib.pyplotzostała zaimportowana jakoplt). - Użyj pandas i matplotlib, aby utworzyć histogram jednodniowej procentowej zmiany ceny zamknięcia po korekcie (użyj
.pct_change()) dla SPY i LNG.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()