Імпорт файлу частинами
Коли ви працюєте з великими файлами, зручніше завантажувати й опрацьовувати дані частинами. Попрактикуймо цей підхід на податкових даних штату Вермонт.
Перші 500 рядків уже завантажено як vt_data_first500. Ви отримаєте наступні 500 рядків. Для цього використайте кілька аргументів: nrows і skiprows, щоб вибрати потрібні записи, header, щоб повідомити pandas, що дані не мають назв стовпців, і names, щоб передати відсутні назви стовпців. Також скористайтеся функцією list(), щоб отримати назви стовпців із vt_data_first500 для повторного використання.
pandas імпортовано як pd.
Ця вправа є частиною курсу
Оптимізоване завантаження даних із pandas
Інструкції до вправи
- Використайте
nrowsіskiprows, щоб створити датафреймvt_data_next500із наступними 500 рядками. - Установіть аргумент
header, щобpandasзнала, що рядка заголовків немає. - Задайте назви стовпців у
vt_data_next500, передавши до аргументуnamesсписок зі стовпцямиvt_data_first500.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())