Nạp CSV vào DataFrame
Ở bài trước, bạn đã thấy một cách tạo DataFrame từ một RDD. Nói chung, nạp dữ liệu từ tệp CSV là cách phổ biến nhất để tạo DataFrame. Trong bài này, bạn sẽ tạo một PySpark DataFrame từ tệp people.csv đã được cung cấp sẵn qua biến file_path và xác nhận đối tượng tạo ra là một PySpark DataFrame.
Lưu ý, bạn đã có sẵn SparkSession spark và biến file_path (đường dẫn tới tệp people.csv) trong không gian làm việc của bạn.
Bài tập này là một phần của khóa học
Nền tảng Big Data với PySpark
Hướng dẫn bài tập
- Tạo một DataFrame từ biến
file_path, là đường dẫn đến tệppeople.csv. - Xác nhận đầu ra là một PySpark DataFrame.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))