開始使用免費開始

從 Parquet 檔載入 DataFrame

工作空間中有一個名為 sherlock_sentences.parquet 的 DataFrame 檔案。這個 DataFrame 的每一列包含一個子句。每個子句由一連串的單字組成,並以標點符號(例如句點、引號,以及其他用來標示句子或句子片段的自然語言分隔符)與其他子句分隔。你的任務(如果你願意接受)是將這個檔案載入。

本練習屬於課程

Python Spark SQL 入門

檢視課程

練習說明

  • 載入 sherlock_sentences.parquet
  • 篩選條件為「id > 70」,並顯示前 5 列。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load the dataframe
df = ____('sherlock_sentences.parquet')

# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)
編輯並執行程式碼