Začněte nyníZačněte zdarma

Zápis schématu

Schémata jsme už načítali různými způsoby. Teď si jedno definujeme přímo. Použijeme datový slovník:

Proměnná Popis
age Věk osoby
education_num Vzdělání podle stupně
marital_status Rodinný stav
occupation Povolání
income Kategorický příjem

Toto cvičení je součástí kurzu

Introduction to PySpark

Zobrazit kurz

Pokyny k cvičení

  • Definuj schéma dat – zadej názvy sloupců (age, education_num, marital_status, occupation a income) a jejich datové typy; jako argument sep= nastav čárku.
  • Načti data z čárkami odděleného souboru adult_reduced_100.csv.
  • Vypiš schéma výsledného DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
                     ____("____",____()),
                     ____("marital_status",StringType()),
                     StructField("____",____()),
                     ____("____",____()),
                    ])

# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)

# Print out the schema
census_adult.____
Upravit a spustit kód