Zacznij terazZacznij za darmo

Definiowanie schematu

Wczytywaliśmy już schematy na różne sposoby. Teraz zdefiniujemy schemat bezpośrednio, korzystając ze słownika danych:

Zmienna Opis
age Wiek osoby
education_num Wykształcenie według stopnia
marital_status Stan cywilny
occupation Zawód
income Kategoryczny poziom dochodu

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zdefiniuj schemat danych, podając nazwy kolumn (age, education_num, marital_status, occupation i income) oraz ich typy, a dla argumentu sep= ustaw przecinek.
  • Wczytaj dane z pliku z wartościami rozdzielanymi przecinkami o nazwie adult_reduced_100.csv.
  • Wyświetl schemat powstałego DataFrame.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

from pyspark.sql.types import StructType, StructField, IntegerType, StringType

# Fill in the schema with the columns you need from the exercise instructions
schema = StructType([____("____",____()),
                     ____("____",____()),
                     ____("marital_status",StringType()),
                     StructField("____",____()),
                     ____("____",____()),
                    ])

# Read in the CSV, using the schema you defined above
census_adult = spark.read.csv("adult_reduced_100.csv", sep='____', header=False, schema=schema)

# Print out the schema
census_adult.____
Edytuj i uruchom kod