CommencezCommencez gratuitement

Filtrer les doublons

Les tableaux de données heart_2 et cardio_2 que vous avez filtrés pour les valeurs manquantes sont disponibles dans votre espace de travail. Votre objectif est de sélectionner une sonde représentative par gène dans chaque data.table afin que chaque gène n'ait qu'une seule entrée dans le résultat de la jointure. Vous souhaitez choisir la sonde avec l'association la plus faible pour obtenir une estimation prudente de la reproductibilité. La colonne "change" contient le facteur de variation des niveaux d'expression pour chaque sonde entre les sujets en bonne santé et ceux atteints d'une maladie cardiaque*. La colonne "pvalue" contient la valeur p indiquant la force de l'association. Les lignes sont triées par ordre décroissant de force d'association (par valeur P croissante).

* Remarque : les associations sont générées aléatoirement et ne sont représentatives d'aucune découverte biologique réelle ni d'un jeu de données réel.

Cette activité fait partie du cours

Jointure de données avec data.table en R

Voir le cours

Instructions de l’exercice

  • Utilisez la fonction unique() (docs) pour supprimer les entrées en double dans la colonne "gene" dans heart_2 et cardio_2. Conservez uniquement la dernière ligne pour chaque gène.
  • Effectuez une jointure interne de cardio_3 à heart_3 avec la fonction merge(). Ajoutez les suffixes ".heart" et ".cardio" aux colonnes "change" et "pvalue".

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___

# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible
Modifier et exécuter le code