开始使用免费开始使用

分块导入文件

处理大型文件时,分批加载并处理数据会更高效。让我们在 Vermont 的税务数据上练习这一流程。

前 500 行已作为 vt_data_first500 载入。您需要获取接下来的 500 行。为此,您将使用几个关键字参数:用 nrowsskiprows 获取正确的记录,用 header 告诉 pandas 数据没有列名,再用 names 提供缺失的列名。您还需要使用 list() 函数,从 vt_data_first500 中获取列名以复用。

pandas 已以 pd 导入。

本练习是课程的一部分

使用 pandas 高效导入数据

查看课程

练习说明

  • 使用 nrowsskiprows 创建一个包含接下来的 500 行的数据框 vt_data_next500
  • 设置 header 参数,让 pandas 知道没有表头行。
  • 通过将 vt_data_first500 的列名列表传给 names 参数,为 vt_data_next500 指定列名。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create dataframe of next 500 rows with labeled columns
vt_data_next500 = pd.read_csv("vt_tax_data_2016.csv", 
                       		  ____,
                       		  ____,
                       		  ____,
                       		  ____)

# View the Vermont dataframes to confirm they're different
print(vt_data_first500.head())
print(vt_data_next500.head())
编辑并运行代码