CommencezCommencez gratuitement

Un extracteur de contenu

Dans les exercices précédents, vous avez vérifié que tous les éléments du vecteur URLs fourni renvoient un code d'état 200. Maintenant que vous savez qu'ils sont accessibles, allons plus loin dans l'exploration du Web en procédant à une extraction de contenu.

Pour ce faire, nous utiliserons des fonctions du paquet rvest, qui seront préremplies avec partial(). Les fonctions que nous écrirons dans cet exercice extraieront tous les nœuds HTML H2 d'une page — sur une page Web, ces nœuds H2 correspondent aux en-têtes de niveau 2. Une fois ces titres extraits, la fonction html_text() servira à récupérer le texte à partir du code HTML brut.

purrr et rvest ont été chargés pour vous, et le vecteur urls est disponible dans votre espace de travail.

Cette activité fait partie du cours

Programmation fonctionnelle intermédiaire avec purrr

Voir le cours

Instructions de l’exercice

  • Commencez par préremplir html_nodes() avec css = "h2".

  • Combinez cette nouvelle fonction entre read_html et html_text pour créer un extracteur de texte pour les en-têtes H2.

  • Exécutez cette fonction sur le vecteur urls et nommez le résultat.

  • Affichez le résultat pour voir à quoi il ressemble.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Modifier et exécuter le code