Filtrarea duplicatelor
Tabelele de date heart_2 și cardio_2, filtrate pentru valorile lipsă, sunt disponibile în spațiul tău de lucru. Scopul tău este să selectezi câte o sondă reprezentativă per genă în fiecare data.table, astfel încât fiecare genă să apară o singură dată în rezultatul joinului. Vrei să selectezi sonda cu cea mai slabă asociere, pentru a obține o estimare conservatoare a reproductibilității. Coloana "change" conține modificarea proporțională a nivelurilor de expresie pentru fiecare sondă, între subiecții sănătoși și cei cu boli de inimă*. Coloana "pvalue" conține valoarea p pentru puterea asocierii. Rândurile sunt ordonate descrescător după puterea asocierii (adică crescător după valoarea P).
* Notă: asocierile sunt generate aleatoriu și nu reprezintă nicio descoperire biologică reală sau un set de date real.
Acest exercițiu face parte din cursul
Îmbinarea datelor cu data.table în R
Instrucțiuni pentru exercițiu
- Folosește funcția
unique()(docs) pentru a elimina intrările duplicate din coloana"gene"atât înheart_2, cât și încardio_2. Păstrează doar ultimul rând pentru fiecare genă. - Realizează un inner join între
cardio_3șiheart_3folosind funcțiamerge(). Adaugă sufixele".heart"și".cardio"la coloanele"change"și"pvalue".
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible