开始使用免费开始使用

从 parquet 文件加载 dataframe

在您的工作区中有一个名为 sherlock_sentences.parquet 的 dataframe 文件。该 dataframe 的每一行包含一个从句。每个从句由一串单词组成,并由句号、引号等自然语言分隔符与其他从句分开,这些分隔符表示一句话或句子片段。您的任务(如果您决定接受)是加载此文件。

本练习是课程的一部分

Python 中的 Spark SQL 入门

查看课程

练习说明

  • 加载 sherlock_sentences.parquet
  • 过滤条件为 "id > 70",并显示前 5 行。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load the dataframe
df = ____('sherlock_sentences.parquet')

# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)
编辑并运行代码