Определение схемы вручную
Мы уже загружали схемы несколькими способами. Теперь давайте определим схему напрямую. Воспользуемся словарём данных:
| Переменная | Описание |
|---|---|
| age | Возраст человека |
| education_num | Уровень образования по степени |
| marital_status | Семейное положение |
| occupation | Профессия |
| income | Категориальный доход |
Это упражнение является частью курса
Введение в PySpark
Инструкции к упражнению
- Задайте схему данных, указав имена столбцов (
age,education_num,marital_status,occupationиincome) и их типы, а также установив запятую в качестве значения аргументаsep=. - Считайте данные из файла с разделителями-запятыми
adult_reduced_100.csv. - Выведите схему полученного DataFrame.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
from pyspark.sql.types import StructType, StructField, IntegerType, StringType
# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
____("____",____()),
____("marital_status",StringType()),
StructField("____",____()),
____("____",____()),
])
# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)
# Print out the schema
census_adult.____