Viết schema
Chúng ta đã nạp Schema theo nhiều cách. Giờ hãy định nghĩa trực tiếp một schema. Ta sẽ dùng một Từ điển dữ liệu:
| Variable | Description |
|---|---|
| age | Tuổi của cá nhân |
| education_num | Trình độ theo bậc học |
| marital_status | Tình trạng hôn nhân |
| occupation | Nghề nghiệp |
| income | Thu nhập phân loại |
Bài tập này là một phần của khóa học
Nhập môn PySpark
Hướng dẫn bài tập
- Chỉ định schema dữ liệu với các tên cột (
age,education_num,marital_status,occupationvàincome) và kiểu cột, đồng thời đặt dấu phẩy cho tham sốsep=. - Đọc dữ liệu từ tệp phân tách bằng dấu phẩy có tên
adult_reduced_100.csv. - In schema của DataFrame thu được.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
from pyspark.sql.types import StructType, StructField, IntegerType, StringType
# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
____("____",____()),
____("marital_status",StringType()),
StructField("____",____()),
____("____",____()),
])
# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)
# Print out the schema
census_adult.____