Zacznij terazZacznij za darmo

Wybór właściwej miary jakości

Początkujący inżynier w firmie Global Retail Analytics uruchamia potok czyszczenia danych na świeżo wczytanym zbiorze online_retail, ale przez przypadek komentuje linię na.drop(subset=["CustomerID"]). Pozostałe kroki — na.fill(), dropDuplicates() i filtr nieprawidłowych rekordów — wykonują się bez błędów.

Która miara jakości natychmiast ujawni ten błąd?

To ćwiczenie jest częścią kursu

Data Transformation with Spark SQL in Databricks

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie