Filtrera dubbletter
Data-tabellerna heart_2 och cardio_2 som du filtrerade för saknade värden finns tillgängliga i din arbetsyta. Målet är att välja en representativ prob per gen i varje data.table, så att varje gen förekommer endast en gång i joinresultatet. Du vill välja proben med den svagaste associationen för att få en konservativ uppskattning av reproducerbarheten. Kolumnen "change" innehåller förändringen i expressionsnivå (fold change) för varje prob mellan friska försökspersoner och de med hjärtsjukdom*. Kolumnen "pvalue" innehåller p-värdet för associationsstyrkan. Raderna är sorterade i fallande ordning efter associationsstyrka (stigande P-värde).
* Obs: associationerna är slumpmässigt genererade och representerar inte något verkligt biologiskt fynd eller riktigt dataset.
Den här övningen är en del av kursen
Att sammanfoga data med data.table i R
Övningsinstruktioner
- Använd funktionen
unique()(docs) för att ta bort dubblettrader i kolumnen"gene"i bådeheart_2ochcardio_2. Behåll endast den sista raden för varje gen. - Gör en inner join av
cardio_3tillheart_3med funktionenmerge(). Lägg till".heart"och".cardio"som suffix till kolumnerna"change"och"pvalue".
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible