Получение уникальных значений
Иногда для анализа не нужны все записи — достаточно уникальных значений одного или нескольких столбцов. Дубликаты можно удалить уже после загрузки данных в датафрейм, однако это можно сделать и на этапе импорта с помощью ключевого слова SQL DISTINCT.
Поскольку hpd311calls содержит данные о проблемах с жильём, можно ожидать, что в большинстве записей указан район. Давайте проверим это предположение, выполнив запрос уникальных комбинаций complaint_type и borough.
pandas импортирован как pd, а движок базы данных создан как engine.
Примечание: SQL-проверка строго следит за порядком столбцов — выбирайте поля именно в указанном порядке.
Это упражнение является частью курса
Эффективный импорт данных с pandas
Инструкции к упражнению
- Создайте запрос, который возвращает значения
DISTINCTдляboroughиcomplaint_type(именно в таком порядке) из таблицыhpd311calls. - Используйте
read_sql(), чтобы загрузить результаты запроса в датафреймissues_and_boros. - Выведите датафрейм и проверьте, подтверждается ли предположение о том, что все обращения, кроме запросов на литературу, содержат указание района.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)