ПочатиПочніть безкоштовно

Дослідіть дані за допомогою EDA

Спершу давайте дослідимо дані. Коли ми починаємо проєкт з машинного навчання (ML), спершу потрібно виконати розвідувальний аналіз даних (EDA), щоб ознайомитися з набором даних. Це включає, зокрема:

  • графіки «сирих» даних
  • гістограми
  • та інше…

Зазвичай я починаю з графіків «сирих» даних і гістограм. Це дає змогу зрозуміти розподіли в наших даних. Якщо розподіл нормальний, ми можемо застосовувати параметричну статистику.

Для вас завантажено два акції у датафрейми pandas: lng_df та spy_df (LNG і SPY). Перегляньте їх за допомогою .head(). Ми використаємо ціни закриття і згодом обсяги як вхідні ознаки для алгоритмів ML.

Примітка: Ми викликатимемо plt.clf() щоразу, коли хочемо створити новий графік, або f = plt.figure().

Ця вправа є частиною курсу

Machine Learning для фінансів у Python

Переглянути курс

Інструкції до вправи

  • Виведіть перші 5 рядків двох датафреймів (lng_df і spy_df) та перегляньте їхній вміст.
  • За допомогою бібліотеки pandas побудуйте графіки «сирих» часових рядів для 'SPY' і 'LNG' за скоригованою ціною закриття ('Adj_Close') — встановіть legend=True у .plot().
  • Використайте plt.show(), щоб показати графік «сирого» часового ряду (модуль matplotlib.pyplot імпортовано як plt).
  • За допомогою pandas і matplotlib побудуйте гістограму одноденної відсоткової зміни скоригованої ціни закриття (використайте .pct_change()) для SPY і LNG.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

print(lng_df.head())  # examine the DataFrames
print(____)  # examine the SPY DataFrame

# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____  # show the plot
plt.clf()  # clear the plot space

# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()
Редагувати та запускати код