Načítání dat ze sčítání lidu
Pojďme vytvořit tvůj první PySpark DataFrame! Soubor adult_reduced.csv obsahuje skupiny dospělých osob rozdělených podle různých demografických kategorií. Data jsou upravena z amerického sčítání lidu a celkem obsahují 32 562 skupin.
Načteme CSV soubor a podíváme se na výsledné schéma.
Slovník dat:
| Proměnná | Popis |
|---|---|
| age | Věk jedince |
| education_num | Úroveň vzdělání podle stupně |
| marital_status | Rodinný stav |
| occupation | Povolání |
| income | Kategorický příjem |
Toto cvičení je součástí kurzu
Introduction to PySpark
Pokyny k cvičení
- Vytvoř PySpark DataFrame ze souboru
"adult_reduced.csv"pomocí metodyspark.read.csv(). - Zobraz výsledný DataFrame.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Read in the CSV
census_adult = ____.____.____(____)
# Show the DataFrame
census_adult.____