Групування та перекодування значень
У стовпці evanston311.category майже 150 різних значень. Проте частина з них подібна за формою «Основна категорія - Деталі». Щоб краще зрозуміти, які запити трапляються найчастіше, варто агрегувати за основною категорією.
Для цього створіть тимчасову таблицю recode, яка відображає унікальні значення category на нові, standardized. Зробіть standardized частиною категорії до дефіса ('-'). Витягніть це значення за допомогою функції split_part():
split_part(string text, delimiter text, field int)
Також потрібно додатково почистити кілька випадків, які не відповідають цьому шаблону.
Потім таблицю evanston311 можна обʼєднати з recode, щоб згрупувати запити за новими значеннями категорії standardized.
Ця вправа є частиною курсу
Розвідувальний аналіз даних у SQL
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
-- Fill in the command below with the name of the temp table
DROP TABLE IF EXISTS ___;
-- Create and name the temporary table
CREATE ___ ___ ___ AS
-- Write the select query to generate the table with distinct values of category and standardized values
SELECT DISTINCT category,
___(___(___, ___, ___)) AS standardized
-- What table are you selecting the above values from?
FROM ___;
-- Look at a few values before the next step
SELECT DISTINCT standardized
FROM recode
WHERE standardized LIKE 'Trash%Cart'
OR standardized LIKE 'Snow%Removal%';