Загрузка датафрейма из файла parquet
В вашем рабочем пространстве доступен файл датафрейма sherlock_sentences.parquet. Каждая строка этого датафрейма содержит одно предложение или его фрагмент. Предложение — это последовательность слов, отделённая от других предложений знаками препинания: точками, кавычками и другими разделителями естественного языка. Ваша задача — загрузить этот файл.
Это упражнение является частью курса
Введение в Spark SQL на Python
Инструкции к упражнению
- Загрузите
sherlock_sentences.parquet. - Отфильтруйте строки по условию "id > 70" и отобразите первые 5 строк.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Load the dataframe
df = ____('sherlock_sentences.parquet')
# Filter and show the first 5 rows
df.where('id > 70').____(____, truncate=False)