Выбор уникальных строк
Если у вас есть категориальная переменная, хранящаяся в факторе, часто бывает полезно узнать, какие в ней категории — для этого используется функция levels(). Для тибла более общая задача — найти строки с уникальными данными. Следуя терминологии SQL, это делается с помощью функции distinct(). Её можно применять непосредственно к набору данных, чтобы найти уникальные комбинации значений в заданном наборе столбцов. Например, чтобы найти уникальные комбинации значений в столбцах x, y и z, нужно написать следующее.
a_tibble %>%
distinct(x, y, z)
Это упражнение является частью курса
Введение в Spark с sparklyr на R
Инструкции к упражнению
Подключение к Spark уже создано и доступно как spark_conn. Тибл, связанный с метаданными треков, хранящимися в Spark, предопределён как track_metadata_tbl.
- Найдите уникальные значения столбца
artist_nameизtrack_metadata_tbl.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
track_metadata_tbl %>%
# Only return rows with distinct artist_name
___