Začněte nyníZačněte zdarma

Filtrování duplicit

V pracovním prostředí máš k dispozici datové tabulky heart_2 a cardio_2, které jsi vyfiltroval/a pro chybějící hodnoty. Tvým cílem je vybrat jeden reprezentativní probe pro každý gen v každém data.table tak, aby měl každý gen ve výsledku joinu pouze jeden záznam. Chceš vybrat probe s nejslabší asociací, čímž získáš konzervativní odhad reprodukovatelnosti. Sloupec "change" obsahuje násobnou změnu úrovní exprese každého probu mezi zdravými jedinci a těmi se srdeční chorobou*. Sloupec "pvalue" obsahuje p-hodnotu síly asociace. Řádky jsou seřazeny sestupně podle síly asociace (vzestupně podle p-hodnoty).

* Poznámka: asociace jsou generovány náhodně a nepředstavují žádný skutečný biologický nález ani reálný dataset.

Toto cvičení je součástí kurzu

Joining Data with data.table in R

Zobrazit kurz

Pokyny k cvičení

  • Pomocí funkce unique() (docs) odstraň duplicitní záznamy ve sloupci "gene" v tabulkách heart_2 i cardio_2. Ponech pouze poslední řádek pro každý gen.
  • Proveď inner join cardio_3 k heart_3 pomocí funkce merge(). Přidej sufixy ".heart" a ".cardio" ke sloupcům "change" a "pvalue".

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___

# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible
Upravit a spustit kód