Odstraňování částečných duplikátů
Teď, když jsi identifikoval/a a odstranil/a úplné duplikáty, je čas zkontrolovat částečné duplikáty. S těmi se pracuje o něco složitěji než s úplnými. V tomto cvičení nejdřív najdeš případné částečné duplikáty a pak si procvičíš nejčastější techniku, jak s nimi naložit – odstraníš všechny částečné duplikáty a ponecháš vždy jen první výskyt.
dplyr je načten a datová sada bike_share_rides je k dispozici.
Toto cvičení je součástí kurzu
Čištění dat v R
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Find duplicated ride_ids
bike_share_rides %>%
# Count the number of occurrences of each ride_id
___ %>%
# Filter for rows with a count > 1
___