Kom igångKom igång gratis

Filtrera dubbletter

Data-tabellerna heart_2 och cardio_2 som du filtrerade för saknade värden finns tillgängliga i din arbetsyta. Målet är att välja en representativ prob per gen i varje data.table, så att varje gen förekommer endast en gång i joinresultatet. Du vill välja proben med den svagaste associationen för att få en konservativ uppskattning av reproducerbarheten. Kolumnen "change" innehåller förändringen i expressionsnivå (fold change) för varje prob mellan friska försökspersoner och de med hjärtsjukdom*. Kolumnen "pvalue" innehåller p-värdet för associationsstyrkan. Raderna är sorterade i fallande ordning efter associationsstyrka (stigande P-värde).

* Obs: associationerna är slumpmässigt genererade och representerar inte något verkligt biologiskt fynd eller riktigt dataset.

Den här övningen är en del av kursen

Att sammanfoga data med data.table i R

Visa kurs

Övningsinstruktioner

  • Använd funktionen unique() (docs) för att ta bort dubblettrader i kolumnen "gene" i både heart_2 och cardio_2. Behåll endast den sista raden för varje gen.
  • Gör en inner join av cardio_3 till heart_3 med funktionen merge(). Lägg till ".heart" och ".cardio" som suffix till kolumnerna "change" och "pvalue".

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___

# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible
Redigera och kör kod