ПочатиПочніть безкоштовно

Завантаження датафрейму з файлу parquet

У вашому робочому середовищі доступний файл датафрейму sherlock_sentences.parquet. Кожен рядок цього датафрейму містить одну клаузу. Клауза — це послідовність слів, відокремлена від інших клауз розділовими знаками, як-от крапки, лапки та інші роздільники природної мови, що позначають речення або його фрагмент. Ваше завдання — завантажити цей файл.

Ця вправа є частиною курсу

Вступ до Spark SQL у Python

Переглянути курс

Інструкції до вправи

  • Завантажте sherlock_sentences.parquet.
  • Застосуйте фільтр «id > 70» і покажіть перші 5 рядків.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Load the dataframe
df = ____('sherlock_sentences.parquet')

# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)
Редагувати та запускати код