Importowanie plików płaskich jako DataFrame z użyciem pandas (2)
W poprzednim ćwiczeniu udało ci się zaimportować pliki płaskie do DataFrame biblioteki pandas. Dodatkową zaletą jest to, że można wtedy w prosty sposób uzyskać odpowiadającą tablicę numpy – wystarczy skorzystać z metody .to_numpy(). Teraz masz szansę to wypróbować na zbiorze danych MNIST, dostępnym jako digits.csv.
Funkcja pd.read_csv() przyjmuje kilka argumentów, które przydadzą ci się w tym ćwiczeniu:
nrowspozwala określić, ile wierszy wczytać z pliku. Na przykładnrows=10zaimportuje tylko pierwsze 10 wierszy.headerprzyjmuje numery wierszy, które mają być użyte jako etykiety kolumn, i wyznacza początek danych. Jeśli plik nie zawiera wiersza nagłówkowego, możesz ustawićheader=None– wtedypandasautomatycznie przypisze kolumnom etykiety całkowitoliczbowe zaczynające się od 0 (np. 0, 1, 2, …).
To ćwiczenie jest częścią kursu
Wprowadzenie do importowania danych w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj pierwsze 5 wierszy pliku do DataFrame za pomocą funkcji
pd.read_csv()i przypisz wynik do zmiennejdata. Skorzystaj z argumentównrowsiheader. Pamiętaj, że plik nie zawiera wiersza nagłówkowego. - Utwórz tablicę
numpyna podstawie DataFrame przechowywanego wdatai przypisz ją do zmiennejdata_array. - Wykonaj
print(type(data_array)), aby wyświetlić typ danych zmiennejdata_array.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))