Bắt đầu ngayBắt đầu miễn phí

Bỏ qua khâu trung gian

Giờ bạn đã biết cách đưa dữ liệu vào Spark thông qua pandas, nhưng có lẽ bạn đang tự hỏi: sao phải dùng pandas làm gì? Chẳng phải đọc thẳng file văn bản vào Spark sẽ dễ hơn sao? Tất nhiên là dễ hơn rồi!

May mắn là SparkSession của bạn có thuộc tính .read với nhiều phương thức để đọc các nguồn dữ liệu khác nhau vào Spark DataFrame. Nhờ đó, bạn có thể tạo một DataFrame từ file .csv y hệt như với pandas DataFrame thông thường!

Biến file_path là một chuỗi đường dẫn tới file airports.csv. File này chứa thông tin về các sân bay trên khắp thế giới.

Một SparkSession tên là spark đã có sẵn trong môi trường làm việc của bạn.

Bài tập này là một phần của khóa học

Nền tảng về PySpark

Xem khóa học

Hướng dẫn bài tập

  • Dùng phương thức .read.csv() để tạo một Spark DataFrame tên airports
    • Đối số thứ nhất là file_path
    • Truyền đối số header=True để Spark biết lấy tên cột từ dòng đầu tiên của file.
  • In DataFrame này ra bằng cách gọi .show().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"

# Read in the airports data
airports = ____.____.____(____, ____=____)

# Show the data
____.____()
Chỉnh sửa và Chạy Mã