Завантаження датафрейму з файлу parquet
У вашому робочому середовищі доступний файл датафрейму sherlock_sentences.parquet. Кожен рядок цього датафрейму містить одну клаузу. Клауза — це послідовність слів, відокремлена від інших клауз розділовими знаками, як-от крапки, лапки та інші роздільники природної мови, що позначають речення або його фрагмент. Ваше завдання — завантажити цей файл.
Ця вправа є частиною курсу
Вступ до Spark SQL у Python
Інструкції до вправи
- Завантажте
sherlock_sentences.parquet. - Застосуйте фільтр «id > 70» і покажіть перші 5 рядків.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)