Filtrer les doublons
Les tableaux de données heart_2 et cardio_2 que vous avez filtrés pour les valeurs manquantes sont disponibles dans votre espace de travail. Votre objectif est de sélectionner une sonde représentative par gène dans chaque data.table afin que chaque gène n'ait qu'une seule entrée dans le résultat de la jointure. Vous souhaitez choisir la sonde avec l'association la plus faible pour obtenir une estimation prudente de la reproductibilité. La colonne "change" contient le facteur de variation des niveaux d'expression pour chaque sonde entre les sujets en bonne santé et ceux atteints d'une maladie cardiaque*. La colonne "pvalue" contient la valeur p indiquant la force de l'association. Les lignes sont triées par ordre décroissant de force d'association (par valeur P croissante).
* Remarque : les associations sont générées aléatoirement et ne sont représentatives d'aucune découverte biologique réelle ni d'un jeu de données réel.
Cette activité fait partie du cours
Jointure de données avec data.table en R
Instructions de l’exercice
- Utilisez la fonction
unique()(docs) pour supprimer les entrées en double dans la colonne"gene"dansheart_2etcardio_2. Conservez uniquement la dernière ligne pour chaque gène. - Effectuez une jointure interne de
cardio_3àheart_3avec la fonctionmerge(). Ajoutez les suffixes".heart"et".cardio"aux colonnes"change"et"pvalue".
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible