Přizpůsobení importu v pandas
Balíček pandas si skvěle poradí s mnoha problémy, na které při importu dat narazíš, jako jsou komentáře v flat files, prázdné řádky nebo chybějící hodnoty (NA nebo NaN). Na závěr této kapitoly naimportuješ poškozenou kopii datasetu Titanic titanic_corrupt.txt, která obsahuje komentáře za znakem '#' a je oddělená tabulátorem.
Důležité argumenty funkce pd.read_csv():
sepnastavuje očekávaný oddělovač.- Pro oddělení čárkou použij
','. - Pro oddělení tabulátorem použij
'\t'.
- Pro oddělení čárkou použij
commentpřijímá znaky, za nimiž se v souboru vyskytují komentáře — veškerý text začínající těmito znaky bude ignorován.na_valuespřijímá seznam řetězců, které se mají považovat zaNA/NaN. Některé hodnoty jsou jakoNA/NaNrozpoznávány automaticky; tímto argumentem přidáš další.
Toto cvičení je součástí kurzu
Úvod do importu dat v Pythonu
Pokyny k cvičení
- Doplň argumenty funkce
pd.read_csv()tak, aby správně naimportovala soubortitanic_corrupt.txt:sepnastavuje použitý oddělovač a funguje stejně jako argumentdelimiterfunkcenp.loadtxt(). Soubor, který importuješ, je oddělený tabulátorem.commentpřijímá znaky, za nimiž se v souboru vyskytují komentáře — v tomto případě'#'.na_valuespřijímá seznam řetězců, které se mají považovat zaNA/NaN— v tomto případě řetězec'Nothing'.
- Spusť zbytek kódu, aby se vypsal začátek výsledného DataFrame a zobrazil histogram sloupce
'Age'cestujících na palubě Titaniku.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import matplotlib.pyplot as plt
import matplotlib.pyplot as plt
# Assign filename: file
file = 'titanic_corrupt.txt'
# Import file: data
data = pd.read_csv(file, sep='____', comment='____', na_values=[____])
# Print the head of the DataFrame
print(data.head())
# Plot 'Age' variable in a histogram
pd.DataFrame.hist(data[['Age']])
plt.xlabel('Age (years)')
plt.ylabel('count')
plt.show()