Filtrování duplicit
V pracovním prostředí máš k dispozici datové tabulky heart_2 a cardio_2, které jsi vyfiltroval/a pro chybějící hodnoty. Tvým cílem je vybrat jeden reprezentativní probe pro každý gen v každém data.table tak, aby měl každý gen ve výsledku joinu pouze jeden záznam. Chceš vybrat probe s nejslabší asociací, čímž získáš konzervativní odhad reprodukovatelnosti. Sloupec "change" obsahuje násobnou změnu úrovní exprese každého probu mezi zdravými jedinci a těmi se srdeční chorobou*. Sloupec "pvalue" obsahuje p-hodnotu síly asociace. Řádky jsou seřazeny sestupně podle síly asociace (vzestupně podle p-hodnoty).
* Poznámka: asociace jsou generovány náhodně a nepředstavují žádný skutečný biologický nález ani reálný dataset.
Toto cvičení je součástí kurzu
Joining Data with data.table in R
Pokyny k cvičení
- Pomocí funkce
unique()(docs) odstraň duplicitní záznamy ve sloupci"gene"v tabulkáchheart_2icardio_2. Ponech pouze poslední řádek pro každý gen. - Proveď inner join
cardio_3kheart_3pomocí funkcemerge(). Přidej sufixy".heart"a".cardio"ke sloupcům"change"a"pvalue".
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible