Importowanie pliku we fragmentach
Podczas pracy z dużymi plikami wygodniej jest wczytywać i przetwarzać dane w częściach. Przećwiczmy ten sposób pracy na danych podatkowych z Vermont.
Pierwsze 500 wierszy zostało już wczytane jako vt_data_first500. Teraz pobierzesz kolejne 500 wierszy. W tym celu skorzystasz z kilku argumentów kluczowych: nrows i skiprows, aby wybrać odpowiednie rekordy, header, aby poinformować pandas, że dane nie mają nazw kolumn, oraz names, aby uzupełnić brakujące nazwy kolumn. Przyda ci się też funkcja list(), która pozwoli pobrać nazwy kolumn z vt_data_first500 do ponownego użycia.
Biblioteka pandas została zaimportowana jako pd.
To ćwiczenie jest częścią kursu
Sprawne importowanie danych z pandas
Instrukcje do ćwiczenia
- Użyj argumentów
nrowsiskiprows, aby utworzyć ramkę danychvt_data_next500zawierającą kolejne 500 wierszy. - Ustaw argument
headertak, abypandaswiedział, że dane nie zawierają wiersza nagłówka. - Nadaj kolumnom w
vt_data_next500nazwy, przekazując listę kolumn zvt_data_first500do argumentunames.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())