ПочатиПочніть безкоштовно

Запис схеми

Ми вже завантажували схеми кількома способами. Тож тепер визначимо схему безпосередньо. Скористаємося словником даних:

Змінна Опис
age Вік особи
education_num Освіта за ступенем
marital_status Сімейний стан
occupation Рід занять
income Категоріальний дохід

Ця вправа є частиною курсу

Вступ до PySpark

Переглянути курс

Інструкції до вправи

  • Задайте схему даних, указавши назви стовпців (age,education_num,marital_status,occupation та income) і їхні типи, а також встановивши кому як роздільник у аргументі sep=.
  • Зчитайте дані з файлу з роздільниками-комами adult_reduced_100.csv.
  • Виведіть схему отриманого датафрейму.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
                     ____("____",____()),
                     ____("marital_status",StringType()),
                     StructField("____",____()),
                     ____("____",____()),
                    ])

# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)

# Print out the schema
census_adult.____
Редагувати та запускати код