ÎncepețiÎncepe gratuit

Filtrarea duplicatelor

Tabelele de date heart_2 și cardio_2, filtrate pentru valorile lipsă, sunt disponibile în spațiul tău de lucru. Scopul tău este să selectezi câte o sondă reprezentativă per genă în fiecare data.table, astfel încât fiecare genă să apară o singură dată în rezultatul joinului. Vrei să selectezi sonda cu cea mai slabă asociere, pentru a obține o estimare conservatoare a reproductibilității. Coloana "change" conține modificarea proporțională a nivelurilor de expresie pentru fiecare sondă, între subiecții sănătoși și cei cu boli de inimă*. Coloana "pvalue" conține valoarea p pentru puterea asocierii. Rândurile sunt ordonate descrescător după puterea asocierii (adică crescător după valoarea P).

* Notă: asocierile sunt generate aleatoriu și nu reprezintă nicio descoperire biologică reală sau un set de date real.

Acest exercițiu face parte din cursul

Îmbinarea datelor cu data.table în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește funcția unique() (docs) pentru a elimina intrările duplicate din coloana "gene" atât în heart_2, cât și în cardio_2. Păstrează doar ultimul rând pentru fiecare genă.
  • Realizează un inner join între cardio_3 și heart_3 folosind funcția merge(). Adaugă sufixele ".heart" și ".cardio" la coloanele "change" și "pvalue".

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___

# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible
Editează și rulează codul