Erkunde die Daten mit etwas EDA
Lass uns zuerst die Daten erkunden. Wann immer wir ein Machine-Learning-(ML)-Projekt starten, machen wir zunächst eine explorative Datenanalyse (EDA), um uns mit den Daten vertraut zu machen. Dazu gehören Dinge wie:
- Rohdaten-Plots
- Histogramme
- und mehr …
Ich beginne typischerweise mit Rohdaten-Plots und Histogrammen. So verstehen wir die Verteilungen unserer Daten. Handelt es sich um eine Normalverteilung, können wir zum Beispiel parametrische Statistik anwenden.
Es sind zwei Aktien in pandas-DataFrames für dich geladen: lng_df und spy_df (LNG und SPY). Sieh sie dir mit .head() an. Wir verwenden die Schlusskurse und später auch das Volumen als Eingaben für ML-Algorithmen.
Hinweis: Wir rufen jedes Mal plt.clf() auf, wenn wir einen neuen Plot erstellen wollen, oder f = plt.figure().
Diese Übung ist Teil des Kurses
<Kurs>Maschinelles Lernen für Finanzen in Python</Kurs>Übungsanweisungen
- Gib die ersten 5 Zeilen der beiden DataFrames (
lng_dfundspy_df) aus und schau dir ihren Inhalt an. - Nutze die pandas-Bibliothek, um Roh-Zeitreihen für
'SPY'und'LNG'mit dem bereinigten Schlusskurs ('Adj_Close') zu plotten — setzelegend=Truein.plot(). - Nutze
plt.show(), um den Roh-Zeitreihen-Plot anzuzeigen (matplotlib.pyplotwurde alspltimportiert). - Erstelle mit pandas und matplotlib ein Histogramm der bereinigten Schlusskurse für die prozentuale 1-Tages-Differenz (verwende
.pct_change()) für SPY und LNG.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()