Дослідіть дані за допомогою EDA
Спершу давайте дослідимо дані. Коли ми починаємо проєкт з машинного навчання (ML), спершу потрібно виконати розвідувальний аналіз даних (EDA), щоб ознайомитися з набором даних. Це включає, зокрема:
- графіки «сирих» даних
- гістограми
- та інше…
Зазвичай я починаю з графіків «сирих» даних і гістограм. Це дає змогу зрозуміти розподіли в наших даних. Якщо розподіл нормальний, ми можемо застосовувати параметричну статистику.
Для вас завантажено два акції у датафрейми pandas: lng_df та spy_df (LNG і SPY). Перегляньте їх за допомогою .head(). Ми використаємо ціни закриття і згодом обсяги як вхідні ознаки для алгоритмів ML.
Примітка: Ми викликатимемо plt.clf() щоразу, коли хочемо створити новий графік, або f = plt.figure().
Ця вправа є частиною курсу
Machine Learning для фінансів у Python
Інструкції до вправи
- Виведіть перші 5 рядків двох датафреймів (
lng_dfіspy_df) та перегляньте їхній вміст. - За допомогою бібліотеки pandas побудуйте графіки «сирих» часових рядів для
'SPY'і'LNG'за скоригованою ціною закриття ('Adj_Close') — встановітьlegend=Trueу.plot(). - Використайте
plt.show(), щоб показати графік «сирого» часового ряду (модульmatplotlib.pyplotімпортовано якplt). - За допомогою pandas і matplotlib побудуйте гістограму одноденної відсоткової зміни скоригованої ціни закриття (використайте
.pct_change()) для SPY і LNG.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()