НачатьНачать бесплатно

Получение уникальных значений

Иногда для анализа не нужны все записи — достаточно уникальных значений одного или нескольких столбцов. Дубликаты можно удалить уже после загрузки данных в датафрейм, однако это можно сделать и на этапе импорта с помощью ключевого слова SQL DISTINCT.

Поскольку hpd311calls содержит данные о проблемах с жильём, можно ожидать, что в большинстве записей указан район. Давайте проверим это предположение, выполнив запрос уникальных комбинаций complaint_type и borough.

pandas импортирован как pd, а движок базы данных создан как engine.

Примечание: SQL-проверка строго следит за порядком столбцов — выбирайте поля именно в указанном порядке.

Это упражнение является частью курса

Эффективный импорт данных с pandas

Посмотреть курс

Инструкции к упражнению

  • Создайте запрос, который возвращает значения DISTINCT для borough и complaint_type (именно в таком порядке) из таблицы hpd311calls.
  • Используйте read_sql(), чтобы загрузить результаты запроса в датафрейм issues_and_boros.
  • Выведите датафрейм и проверьте, подтверждается ли предположение о том, что все обращения, кроме запросов на литературу, содержат указание района.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
Редактировать и запускать код