Bỏ qua khâu trung gian
Giờ bạn đã biết cách đưa dữ liệu vào Spark thông qua pandas, nhưng có lẽ bạn đang tự hỏi: sao phải dùng pandas làm gì? Chẳng phải đọc thẳng file văn bản vào Spark sẽ dễ hơn sao? Tất nhiên là dễ hơn rồi!
May mắn là SparkSession của bạn có thuộc tính .read với nhiều phương thức để đọc các nguồn dữ liệu khác nhau vào Spark DataFrame. Nhờ đó, bạn có thể tạo một DataFrame từ file .csv y hệt như với pandas DataFrame thông thường!
Biến file_path là một chuỗi đường dẫn tới file airports.csv. File này chứa thông tin về các sân bay trên khắp thế giới.
Một SparkSession tên là spark đã có sẵn trong môi trường làm việc của bạn.
Bài tập này là một phần của khóa học
Nền tảng về PySpark
Hướng dẫn bài tập
- Dùng phương thức
.read.csv()để tạo một Spark DataFrame tênairports- Đối số thứ nhất là
file_path - Truyền đối số
header=Trueđể Spark biết lấy tên cột từ dòng đầu tiên của file.
- Đối số thứ nhất là
- In DataFrame này ra bằng cách gọi
.show().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()