Načtení části tabulky
Tabulky určené ke čtení lidmi často obsahují více datových sad – například malá firma může mít v jednom listu sešitu zásoby rozdělené do tabulek podle typu produktu. I strukturovaná data mohou mít záhlaví s metadaty, jako je tomu u dat z průzkumu New Developer Survey. Metadata jsou sice užitečná, ale do dataframu je nechceme. Pomocí parametru skiprows funkce read_excel() načteš pouze samotná data. Zároveň vytvoříš řetězec, který předáš parametru usecols, a získáš jen sloupce AD a AW až BA – ty obsahují informace o pracovních cílech do budoucna.
pandas je naimportován jako pd.
Toto cvičení je součástí kurzu
Streamlined Data Ingestion with pandas
Pokyny k cvičení
- Vytvoř řetězec
col_string, který říkápandas, aby načetl sloupecADa rozsahAWažBA. - Načti soubor
fcc_survey_headers.xlsx– nastavskiprowsausecolstak, aby se přeskočily první dva řádky s metadaty a načetly se pouze sloupce uvedené vcol_string. - Zobraz názvy vybraných sloupců ve výsledném dataframu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create string of lettered columns to load
col_string = ____
# Load data with skiprows and usecols set
survey_responses = ____("fcc_survey_headers.xlsx",
____,
____)
# View the names of the columns selected
print(survey_responses.columns)