Začněte nyníZačněte zdarma

Načítání dat ze sčítání lidu

Pojďme vytvořit tvůj první PySpark DataFrame! Soubor adult_reduced.csv obsahuje skupiny dospělých osob rozdělených podle různých demografických kategorií. Data jsou upravena z amerického sčítání lidu a celkem obsahují 32 562 skupin.

Načteme CSV soubor a podíváme se na výsledné schéma.

Slovník dat:

Proměnná Popis
age Věk jedince
education_num Úroveň vzdělání podle stupně
marital_status Rodinný stav
occupation Povolání
income Kategorický příjem

Toto cvičení je součástí kurzu

Introduction to PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř PySpark DataFrame ze souboru "adult_reduced.csv" pomocí metody spark.read.csv().
  • Zobraz výsledný DataFrame.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Read in the CSV
census_adult = ____.____.____(____)

# Show the DataFrame
census_adult.____
Upravit a spustit kód