ÎncepețiÎncepe gratuit

Agregarea duplicatelor parțiale

O altă modalitate de a gestiona duplicatele parțiale este să calculezi o statistică de sumarizare pentru valorile care diferă între ele – de exemplu, media, mediana, maximul sau minimul. Acest lucru poate fi util atunci când nu ești sigur cum au fost colectate datele și preferi o valoare medie, sau când, pe baza cunoștințelor din domeniu, vrei o estimare mai degrabă ridicată decât scăzută (sau invers).

dplyr este încărcat și bike_share_rides este disponibil.

Acest exercițiu face parte din cursul

Curățarea datelor în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Grupează bike_share_rides după ride_id și date.
  • Adaugă o coloană numită duration_min_avg care conține durata medie a curselor pentru ride_id și date din rândul respectiv.
  • Elimină duplicatele pe baza ride_id și date, păstrând toate coloanele din cadrul de date.
  • Elimină coloana duration_min.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
Editează și rulează codul