ПочатиПочніть безкоштовно

Отримання унікальних значень

Іноді для аналізу не потрібні всі записи, а лише унікальні значення в одному або кількох стовпцях. Повторювані значення можна прибрати після завантаження даних у датафрейм, але це можна зробити й під час імпорту за допомогою ключового слова SQL DISTINCT.

Оскільки hpd311calls містить дані про проблеми з житлом, ми очікуємо, що в більшості записів вказано боро. Перевірмо цю гіпотезу, виконавши запит на унікальні комбінації complaint_type/borough.

pandas імпортовано як pd, а рушій бази даних створено як engine.

Примітка: Перевірник SQL дуже вимогливий до порядку стовпців і очікує, що поля буде вибрано у вказаній послідовності.

Ця вправа є частиною курсу

Оптимізоване завантаження даних із pandas

Переглянути курс

Інструкції до вправи

  • Створіть запит, який повертає DISTINCT значення для borough та complaint_type (саме в такому порядку) з hpd311calls.
  • Використайте read_sql() для завантаження результатів запиту в датафрейм issues_and_boros.
  • Надрукуйте датафрейм, щоб перевірити припущення, що всі звернення, окрім запитів літератури, мають вказані боро.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create query for unique combinations of borough and complaint_type
query = """
SELECT ____ ____, 
       ____
  ____ hpd311calls;
"""

# Load results of query to a dataframe
issues_and_boros = ____

# Check assumption about issues and boroughs
print(____)
Редагувати та запускати код