Esplora i dati con un po' di EDA
Per iniziare, esploriamo i dati. Ogni volta che avviamo un progetto di Machine Learning (ML), dobbiamo prima fare un po' di analisi esplorativa dei dati (EDA) per familiarizzare con il dataset. Questo include elementi come:
- grafici dei dati grezzi
- istogrammi
- e altro ancora…
In genere comincio con grafici dei dati grezzi e istogrammi. Questo ci permette di capire le distribuzioni dei dati. Se è una distribuzione normale, possiamo usare statistiche parametriche.
Ci sono due titoli azionari già caricati in DataFrame di pandas: lng_df e spy_df (LNG e SPY). Dai un'occhiata con .head(). Useremo i prezzi di chiusura e, in seguito, il volume come input per gli algoritmi di ML.
Nota: chiameremo plt.clf() ogni volta che vogliamo creare un nuovo grafico, oppure f = plt.figure().
Questo esercizio fa parte del corso
Machine Learning per la finanza in Python
Istruzioni dell'esercizio
- Stampa le prime 5 righe dei due DataFrame (
lng_dfespy_df) ed esamina il loro contenuto. - Usa la libreria pandas per tracciare le serie storiche grezze di
'SPY'e'LNG'con il prezzo di chiusura rettificato ('Adj_Close') — impostalegend=Truein.plot(). - Usa
plt.show()per visualizzare il grafico della serie storica grezza (matplotlib.pyplotè stato importato comeplt). - Usa pandas e matplotlib per creare un istogramma della variazione percentuale giornaliera (1 giorno) del prezzo di chiusura rettificato (usa
.pct_change()) per SPY e LNG.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()