Movies lồng nhau
Bạn đang tò mò về một bộ dữ liệu movies mà bạn đã lưu trên máy tính một thời gian, chứa dữ liệu về nhiều bộ phim khác nhau. Bạn muốn phân tích dữ liệu đó, nhưng nhận ra nó đang ở định dạng JSON lồng nhau.
Để đọc nó vào một DataFrame, bạn sẽ cần dùng hàm vừa học. Sau đó, bạn sẽ biến đổi (reshape) DataFrame nhận được để dễ làm việc hơn.
Tệp JSON bán cấu trúc tên là movies đã sẵn sàng cho bạn. Hãy nhớ kiểm tra nó trong console!
Bài tập này là một phần của khóa học
Tái định dạng dữ liệu với pandas
Hướng dẫn bài tập
- Import hàm
json_normalize()từpandas. - Chuẩn hóa JSON nằm trong
movies. Tách các tên được tạo ra từ các bản ghi lồng nhau bằng dấu gạch dưới. - Biến đổi (reshape) DataFrame
movies_normthu được từ dạng rộng sang dạng dài, sử dụng các cộtdirectorvàproducerlàm chỉ số duy nhất. Đặt tên cho biến mới được tạo từ các cộtmovies, bắt đầu bằngfeatures, được phân tách bằng dấu gạch dưới với hậu tố chứa các từ.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the json_normalize function
____
# Normalize movies and separate the new columns with an underscore
movies_norm = ____(____, sep=____)
# Reshape using director and producer as index, create movies from column starting from features
movies_long = pd.____(____, stubnames=____,
i=____, j=____,
sep=____, suffix=____)
# Print movies_long
print(movies_long)