Загрузка файла по частям
При работе с большими файлами удобнее загружать и обрабатывать данные по частям. Давайте потренируемся на данных о налогах штата Вермонт.
Первые 500 строк уже загружены как vt_data_first500. Теперь вам нужно получить следующие 500 строк. Для этого используйте несколько именованных аргументов: nrows и skiprows — чтобы выбрать нужные записи, header — чтобы сообщить pandas об отсутствии заголовка, и names — чтобы задать имена столбцов вручную. Также используйте функцию list(), чтобы взять названия столбцов из vt_data_first500.
pandas уже импортирован как pd.
Это упражнение является частью курса
Эффективный импорт данных с pandas
Инструкции к упражнению
- С помощью
nrowsиskiprowsсоздайте датафреймvt_data_next500, содержащий следующие 500 строк. - Задайте аргумент
headerтак, чтобыpandasзнал об отсутствии строки заголовка. - Укажите названия столбцов для
vt_data_next500, передав список столбцов изvt_data_first500в аргументnames.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())