Zacznij terazZacznij za darmo

Wczytywanie danych spisowych

Zacznijmy od stworzenia pierwszego DataFrame'a w PySparku! Plik adult_reduced.csv zawiera dane dotyczące dorosłych, pogrupowane według różnych kategorii demograficznych. Dane zostały opracowane na podstawie spisu powszechnego USA i obejmują łącznie 32 562 rekordów.

Wczytaj plik CSV i sprawdź wynikowy schemat danych.

Słownik danych:

Zmienna Opis
age Wiek osoby
education_num Poziom wykształcenia
marital_status Stan cywilny
occupation Zawód
income Kategoria dochodów

To ćwiczenie jest częścią kursu

Wprowadzenie do PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz DataFrame PySpark z pliku "adult_reduced.csv", używając metody spark.read.csv().
  • Wyświetl wynikowy DataFrame.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Read in the CSV
census_adult = ____.____.____(____)

# Show the DataFrame
census_adult.____
Edytuj i uruchom kod