Zápis schématu
Schémata jsme už načítali různými způsoby. Teď si jedno definujeme přímo. Použijeme datový slovník:
| Proměnná | Popis |
|---|---|
| age | Věk osoby |
| education_num | Vzdělání podle stupně |
| marital_status | Rodinný stav |
| occupation | Povolání |
| income | Kategorický příjem |
Toto cvičení je součástí kurzu
Introduction to PySpark
Pokyny k cvičení
- Definuj schéma dat – zadej názvy sloupců (
age,education_num,marital_status,occupationaincome) a jejich datové typy; jako argumentsep=nastav čárku. - Načti data z čárkami odděleného souboru
adult_reduced_100.csv. - Vypiš schéma výsledného DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from pyspark.sql.types import StructType, StructField, IntegerType, StringType
# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
____("____",____()),
____("marital_status",StringType()),
StructField("____",____()),
____("____",____()),
])
# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)
# Print out the schema
census_adult.____