分块导入文件
处理大型文件时,分批加载并处理数据会更高效。让我们在 Vermont 的税务数据上练习这一流程。
前 500 行已作为 vt_data_first500 载入。您需要获取接下来的 500 行。为此,您将使用几个关键字参数:用 nrows 和 skiprows 获取正确的记录,用 header 告诉 pandas 数据没有列名,再用 names 提供缺失的列名。您还需要使用 list() 函数,从 vt_data_first500 中获取列名以复用。
pandas 已以 pd 导入。
本练习是课程的一部分
使用 pandas 高效导入数据
练习说明
- 使用
nrows和skiprows创建一个包含接下来的 500 行的数据框vt_data_next500。 - 设置
header参数,让pandas知道没有表头行。 - 通过将
vt_data_first500的列名列表传给names参数,为vt_data_next500指定列名。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv",
____,
____,
____,
____)
# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())