Отримання унікальних значень
Іноді для аналізу не потрібні всі записи, а лише унікальні значення в одному або кількох стовпцях. Повторювані значення можна прибрати після завантаження даних у датафрейм, але це можна зробити й під час імпорту за допомогою ключового слова SQL DISTINCT.
Оскільки hpd311calls містить дані про проблеми з житлом, ми очікуємо, що в більшості записів вказано боро. Перевірмо цю гіпотезу, виконавши запит на унікальні комбінації complaint_type/borough.
pandas імпортовано як pd, а рушій бази даних створено як engine.
Примітка: Перевірник SQL дуже вимогливий до порядку стовпців і очікує, що поля буде вибрано у вказаній послідовності.
Ця вправа є частиною курсу
Оптимізоване завантаження даних із pandas
Інструкції до вправи
- Створіть запит, який повертає
DISTINCTзначення дляboroughтаcomplaint_type(саме в такому порядку) зhpd311calls. - Використайте
read_sql()для завантаження результатів запиту в датафреймissues_and_boros. - Надрукуйте датафрейм, щоб перевірити припущення, що всі звернення, окрім запитів літератури, мають вказані боро.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____,
____
____ hpd311calls;
"""
# Load results of query to a dataframe
issues_and_boros = ____
# Check assumption about issues and boroughs
print(____)