开始使用免费开始使用

写入文件

在视频中,您看到文件通常会被加载到像 Redshift 这样的 MPP 数据库中,以便进行分析。

典型流程是先把数据写成列式数据文件。然后将这些数据文件上传到存储系统,从那里再复制到数据仓库。以 Amazon Redshift 为例,存储系统通常是 S3。

第一步是将文件写成正确的格式。本练习中,您将选择 Apache Parquet 文件格式。

您的工作区中已有一个名为 film_sdf 的 PySpark DataFrame 和一个名为 film_pdf 的 pandas DataFrame。

本练习是课程的一部分

Data Engineering 入门

查看课程

练习说明

  • pandas 的 DataFrame film_pdf 写成名为 "films_pdf.parquet" 的 parquet 文件。
  • 将 PySpark 的 DataFrame film_sdf 写成名为 "films_sdf.parquet" 的 parquet 文件。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
编辑并运行代码