Plné duplicity
Dostala ses k informaci, že v datovém pipeline pro sdílená kola proběhla aktualizace zaměřená na větší efektivitu – jako vedlejší efekt ale může docházet ke vzniku duplicit. Aby tvoje týdenní skripty pro analýzu statistik jízd fungovaly spolehlivě i nadále, je potřeba nejdříve případné duplicity z datasetu odstranit.
Pokud sdílí více řádků datového rámce stejné hodnoty ve všech sloupcích, jde o plné duplicity. Jejich odstranění je důležité, protože opakující se hodnoty mohou zkreslit souhrnné statistiky, jako je průměr nebo medián. Každá jízda včetně svého ride_id by měla být jedinečná.
Balíček dplyr je načten a datový rámec bike_share_rides je k dispozici.
Toto cvičení je součástí kurzu
Čištění dat v R
Pokyny k cvičení
- Zjisti celkový počet plných duplicit v datovém rámci
bike_share_rides. - Odstraň všechny plné duplicity z
bike_share_ridesa výsledný datový rámec ulož jakobike_share_rides_unique. - Zjisti celkový počet plných duplicit v novém datovém rámci
bike_share_rides_unique.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___