Wybór właściwej miary jakości
Początkujący inżynier w firmie Global Retail Analytics uruchamia potok czyszczenia danych na świeżo wczytanym zbiorze online_retail, ale przez przypadek komentuje linię na.drop(subset=["CustomerID"]). Pozostałe kroki — na.fill(), dropDuplicates() i filtr nieprawidłowych rekordów — wykonują się bez błędów.
Która miara jakości natychmiast ujawni ten błąd?
To ćwiczenie jest częścią kursu
Data Transformation with Spark SQL in Databricks
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie