Importování plochých souborů jako DataFrames pomocí pandas (2)
V předchozím cvičení jsi importoval/a ploché soubory do DataFrame knihovny pandas. Jako bonus je pak snadné získat odpovídající pole numpy pomocí metody .to_numpy(). Teď si to vyzkoušíš na datasetu MNIST, který je k dispozici jako digits.csv.
Funkce pd.read_csv() nabízí několik argumentů, které se ti v tomto cvičení budou hodit:
nrowsumožňuje určit, kolik řádků ze souboru se načte. Napříkladnrows=10importuje pouze prvních 10 řádků.headerpřijímá čísla řádků, která se použijí jako popisky sloupců, a označuje začátek dat. Pokud soubor řádek záhlaví neobsahuje, nastavheader=Noneapandasautomaticky přiřadí celočíselné popisky sloupců začínající od 0 (např. 0, 1, 2, …).
Toto cvičení je součástí kurzu
Úvod do importu dat v Pythonu
Pokyny k cvičení
- Importuj prvních 5 řádků souboru do DataFrame pomocí funkce
pd.read_csv()a výsledek přiřaď do proměnnédata. Budeš potřebovat argumentynrowsaheader. Pamatuj, že tento soubor neobsahuje řádek záhlaví. - Z výsledného DataFrame uloženého v
datavytvoř polenumpya přiřaď ho do proměnnédata_array. - Spusť
print(type(data_array))pro výpis datového typu proměnnédata_array.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))