parquet ファイルからデータフレームを読み込む
作業スペースには sherlock_sentences.parquet というデータフレームファイルがあります。 このデータフレームの各行には単一の節が含まれています。 各節は、ピリオドや引用符など、文や文の一部を示す自然言語の区切り文字によって他の節と区切られた単語の並びです。 あなたのミッションは(受けて立つなら)、このファイルを読み込むことです。
この演習はコースの一部です
Pythonで学ぶ Spark SQL 入門
演習の手順
sherlock_sentences.parquetを読み込みます。- 「id > 70」でフィルタし、先頭5行を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)