分批匯入檔案
處理大型檔案時,將資料分段載入並處理會更容易。讓我們用 Vermont 的稅務資料來練習這個流程。
前 500 列已經載入為 vt_data_first500。你將取得接下來的 500 列。為了做到這點,你會使用多個關鍵字引數:用 nrows 和 skiprows 來抓到正確的筆數,用 header 告訴 pandas 這份資料沒有欄名,並用 names 提供缺少的欄名。你也會使用 list() 函式,從 vt_data_first500 取得欄名以便重用。
已將 pandas 以 pd 匯入。
本練習屬於課程
使用 pandas 的精實資料導入
練習說明
- 使用
nrows與skiprows建立 dataframevt_data_next500,讀取下一個 500 列。 - 設定
header引數,讓pandas知道沒有標題列。 - 透過將
vt_data_first500的欄名清單提供給names引數,為vt_data_next500指定欄名。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())