Bắt đầu ngayBắt đầu miễn phí

Viết schema

Chúng ta đã nạp Schema theo nhiều cách. Giờ hãy định nghĩa trực tiếp một schema. Ta sẽ dùng một Từ điển dữ liệu:

Variable Description
age Tuổi của cá nhân
education_num Trình độ theo bậc học
marital_status Tình trạng hôn nhân
occupation Nghề nghiệp
income Thu nhập phân loại

Bài tập này là một phần của khóa học

Nhập môn PySpark

Xem khóa học

Hướng dẫn bài tập

  • Chỉ định schema dữ liệu với các tên cột (age, education_num, marital_status, occupationincome) và kiểu cột, đồng thời đặt dấu phẩy cho tham số sep=.
  • Đọc dữ liệu từ tệp phân tách bằng dấu phẩy có tên adult_reduced_100.csv.
  • In schema của DataFrame thu được.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
                     ____("____",____()),
                     ____("marital_status",StringType()),
                     StructField("____",____()),
                     ____("____",____()),
                    ])

# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)

# Print out the schema
census_adult.____
Chỉnh sửa và Chạy Mã