Filtrowanie duplikatów
W twoim środowisku pracy dostępne są tabele heart_2 i cardio_2, odfiltrowane wcześniej pod kątem brakujących wartości. Celem jest wybranie jednej reprezentatywnej sondy na gen w każdej data.table, tak aby każdy gen miał tylko jeden wiersz w wynikach złączenia. Chcesz wybrać sondę o najsłabszym powiązaniu, aby uzyskać konserwatywną ocenę odtwarzalności. Kolumna "change" zawiera krotność zmiany ekspresji dla każdej sondy między zdrowymi osobami a osobami z chorobą serca*. Kolumna "pvalue" zawiera wartość p określającą siłę powiązania. Wiersze są posortowane malejąco według siły powiązania (rosnąco według wartości p).
* Uwaga: powiązania są generowane losowo i nie odzwierciedlają żadnych rzeczywistych wyników biologicznych ani prawdziwego zbioru danych.
To ćwiczenie jest częścią kursu
Łączenie danych z data.table w R
Instrukcje do ćwiczenia
- Użyj funkcji
unique()(dokumentacja), aby usunąć zduplikowane wpisy w kolumnie"gene"w obu tabelach:heart_2icardio_2. Zachowaj tylko ostatni wiersz dla każdego genu. - Wykonaj złączenie wewnętrzne (inner join) tabeli
cardio_3zheart_3za pomocą funkcjimerge(). Dodaj sufiksy".heart"i".cardio"do kolumn"change"i"pvalue".
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible