写入文件
在视频中,您看到文件通常会被加载到像 Redshift 这样的 MPP 数据库中,以便进行分析。
典型流程是先把数据写成列式数据文件。然后将这些数据文件上传到存储系统,从那里再复制到数据仓库。以 Amazon Redshift 为例,存储系统通常是 S3。
第一步是将文件写成正确的格式。本练习中,您将选择 Apache Parquet 文件格式。
您的工作区中已有一个名为 film_sdf 的 PySpark DataFrame 和一个名为 film_pdf 的 pandas DataFrame。
本练习是课程的一部分
Data Engineering 入门
练习说明
- 将
pandas的 DataFramefilm_pdf写成名为"films_pdf.parquet"的 parquet 文件。 - 将 PySpark 的 DataFrame
film_sdf写成名为"films_sdf.parquet"的 parquet 文件。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")