НачатьНачать бесплатно

Определение схемы вручную

Мы уже загружали схемы несколькими способами. Теперь давайте определим схему напрямую. Воспользуемся словарём данных:

Переменная Описание
age Возраст человека
education_num Уровень образования по степени
marital_status Семейное положение
occupation Профессия
income Категориальный доход

Это упражнение является частью курса

Введение в PySpark

Посмотреть курс

Инструкции к упражнению

  • Задайте схему данных, указав имена столбцов (age, education_num, marital_status, occupation и income) и их типы, а также установив запятую в качестве значения аргумента sep=.
  • Считайте данные из файла с разделителями-запятыми adult_reduced_100.csv.
  • Выведите схему полученного DataFrame.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
                     ____("____",____()),
                     ____("marital_status",StringType()),
                     StructField("____",____()),
                     ____("____",____()),
                    ])

# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)

# Print out the schema
census_adult.____
Редактировать и запускать код