Уникальные 5-граммы в отсортированном порядке
В одном из предыдущих уроков вы познакомились с операцией, которая устраняет дубликаты и возвращает уникальные записи. В предыдущем упражнении вы получили часто встречающиеся 5-граммы. Теперь объединим эти два подхода, чтобы найти уникальные 5-граммы, отсортированные по алфавиту в порядке убывания.
Таблица text содержит первые четыре главы текста о Шерлоке Холмсе. В ней есть следующие столбцы: word, id и part.
Это упражнение является частью курса
Введение в Spark SQL на Python
Инструкции к упражнению
- Получите последние десять уникальных 5-граммов, отсортированных по алфавиту в порядке убывания.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Unique 5-tuples sorted in descending order
query = """
SELECT ____ w1, w2, w3, w4, w5 FROM (
SELECT word AS w1,
____(word,____) OVER(PARTITION BY ____ ORDER BY ____ ) AS w2,
____(word,____) OVER(PARTITION BY ____ ORDER BY ____ ) AS w3,
____(word,____) OVER(PARTITION BY ____ ORDER BY ____ ) AS w4,
____(word,____) OVER(PARTITION BY ____ ORDER BY ____ ) AS w5
FROM text
)
ORDER BY w1 DESC, w2 DESC, ____ DESC, w4 ____, ____ ____
LIMIT 10
"""
df = spark.sql(query)
df.show()