НачатьНачать бесплатно

Выбор уникальных строк

Если у вас есть категориальная переменная, хранящаяся в факторе, часто бывает полезно узнать, какие в ней категории — для этого используется функция levels(). Для тибла более общая задача — найти строки с уникальными данными. Следуя терминологии SQL, это делается с помощью функции distinct(). Её можно применять непосредственно к набору данных, чтобы найти уникальные комбинации значений в заданном наборе столбцов. Например, чтобы найти уникальные комбинации значений в столбцах x, y и z, нужно написать следующее.

a_tibble %>%
  distinct(x, y, z)

Это упражнение является частью курса

Введение в Spark с sparklyr на R

Посмотреть курс

Инструкции к упражнению

Подключение к Spark уже создано и доступно как spark_conn. Тибл, связанный с метаданными треков, хранящимися в Spark, предопределён как track_metadata_tbl.

  • Найдите уникальные значения столбца artist_name из track_metadata_tbl.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

track_metadata_tbl %>%
  # Only return rows with distinct artist_name
  ___
Редактировать и запускать код