Khám phá dữ liệu với EDA
Trước tiên, hãy khám phá dữ liệu. Bất cứ khi nào bắt đầu một dự án Machine Learning (ML), bạn cần thực hiện phân tích dữ liệu khám phá (EDA) để làm quen với dữ liệu. Việc này bao gồm:
- vẽ biểu đồ dữ liệu thô
- histogram
- và nhiều nội dung khác…
Mình thường bắt đầu với biểu đồ dữ liệu thô và histogram. Cách này giúp bạn hiểu phân phối của dữ liệu. Nếu là phân phối chuẩn, bạn có thể dùng các phương pháp thống kê tham số.
Có hai mã cổ phiếu đã được nạp sẵn vào pandas DataFrame: lng_df và spy_df (LNG và SPY). Hãy xem nhanh chúng với .head(). Chúng ta sẽ dùng giá đóng cửa và sau đó là khối lượng làm đầu vào cho các thuật toán ML.
Lưu ý: Mỗi lần muốn vẽ biểu đồ mới, ta sẽ gọi plt.clf() hoặc f = plt.figure().
Bài tập này là một phần của khóa học
Machine Learning cho Tài chính bằng Python
Hướng dẫn bài tập
- In ra 5 dòng đầu tiên của hai DataFrame (
lng_dfvàspy_df) và xem nội dung của chúng. - Dùng thư viện pandas để vẽ chuỗi thời gian thô cho
'SPY'và'LNG'với giá điều chỉnh khi đóng cửa ('Adj_Close') — đặtlegend=Truetrong.plot(). - Dùng
plt.show()để hiển thị biểu đồ chuỗi thời gian thô (đã importmatplotlib.pyplotlàplt). - Dùng pandas và matplotlib để vẽ histogram của phần trăm chênh lệch 1 ngày của giá điều chỉnh (dùng
.pct_change()) cho SPY và LNG.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()