Запис схеми
Ми вже завантажували схеми кількома способами. Тож тепер визначимо схему безпосередньо. Скористаємося словником даних:
| Змінна | Опис |
|---|---|
| age | Вік особи |
| education_num | Освіта за ступенем |
| marital_status | Сімейний стан |
| occupation | Рід занять |
| income | Категоріальний дохід |
Ця вправа є частиною курсу
Вступ до PySpark
Інструкції до вправи
- Задайте схему даних, указавши назви стовпців (
age,education_num,marital_status,occupationтаincome) і їхні типи, а також встановивши кому як роздільник у аргументіsep=. - Зчитайте дані з файлу з роздільниками-комами
adult_reduced_100.csv. - Виведіть схему отриманого датафрейму.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from pyspark.sql.types import StructType, StructField, IntegerType, StringType
# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
____("____",____()),
____("marital_status",StringType()),
StructField("____",____()),
____("____",____()),
])
# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)
# Print out the schema
census_adult.____