Bắt đầu ngayBắt đầu miễn phí

Nạp dữ liệu chuyến bay

Trong bài này bạn sẽ nạp một số dữ liệu chuyến bay của các hãng hàng không từ một tệp CSV. Để bài tập chạy nhanh, dữ liệu đã được rút gọn còn 50.000 bản ghi. Bạn có thể lấy một bộ dữ liệu lớn hơn cùng định dạng tại đây.

Ghi chú về định dạng CSV:

  • các trường được phân tách bằng dấu phẩy (đây là dấu phân tách mặc định) và
  • dữ liệu khuyết được ký hiệu bằng chuỗi 'NA'.

Từ điển dữ liệu:

  • mon — tháng (số nguyên từ 1 đến 12)
  • dom — ngày trong tháng (số nguyên từ 1 đến 31)
  • dow — thứ trong tuần (số nguyên; 1 = Thứ Hai và 7 = Chủ Nhật)
  • carrier — hãng vận chuyển (mã IATA)
  • flight — số hiệu chuyến bay
  • org — sân bay xuất phát (mã IATA)
  • mile — khoảng cách (dặm)
  • depart — thời gian cất cánh (giờ thập phân)
  • duration — thời lượng dự kiến (phút)
  • delay — độ trễ (phút)

pyspark đã được nhập sẵn cho bạn và phiên làm việc đã được khởi tạo.

Lưu ý: Dữ liệu đã được lấy mẫu giảm kích thước mạnh.

Bài tập này là một phần của khóa học

Machine Learning với PySpark

Xem khóa học

Hướng dẫn bài tập

  • Đọc dữ liệu từ tệp CSV tên flights.csv. Tự động gán kiểu dữ liệu cho các cột. Xử lý dữ liệu khuyết.
  • Dữ liệu có bao nhiêu bản ghi?
  • Xem thử năm bản ghi đầu tiên.
  • Những kiểu dữ liệu nào đã được gán cho các cột? Trông có hợp lý không?

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
Chỉnh sửa và Chạy Mã