Bắt đầu ngayBắt đầu miễn phí

Movies lồng nhau

Bạn đang tò mò về một bộ dữ liệu movies mà bạn đã lưu trên máy tính một thời gian, chứa dữ liệu về nhiều bộ phim khác nhau. Bạn muốn phân tích dữ liệu đó, nhưng nhận ra nó đang ở định dạng JSON lồng nhau.

Để đọc nó vào một DataFrame, bạn sẽ cần dùng hàm vừa học. Sau đó, bạn sẽ biến đổi (reshape) DataFrame nhận được để dễ làm việc hơn.

Tệp JSON bán cấu trúc tên là movies đã sẵn sàng cho bạn. Hãy nhớ kiểm tra nó trong console!

Bài tập này là một phần của khóa học

Tái định dạng dữ liệu với pandas

Xem khóa học

Hướng dẫn bài tập

  • Import hàm json_normalize() từ pandas.
  • Chuẩn hóa JSON nằm trong movies. Tách các tên được tạo ra từ các bản ghi lồng nhau bằng dấu gạch dưới.
  • Biến đổi (reshape) DataFrame movies_norm thu được từ dạng rộng sang dạng dài, sử dụng các cột directorproducer làm chỉ số duy nhất. Đặt tên cho biến mới được tạo từ các cột movies, bắt đầu bằng features, được phân tách bằng dấu gạch dưới với hậu tố chứa các từ.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the json_normalize function
____

# Normalize movies and separate the new columns with an underscore 
movies_norm = ____(____, sep=____)

# Reshape using director and producer as index, create movies from column starting from features
movies_long = pd.____(____, stubnames=____, 
                      i=____, j=____, 
                      sep=____, suffix=____)

# Print movies_long
print(movies_long)
Chỉnh sửa và Chạy Mã