LoslegenKostenlos starten

Ein Content-Extractor

In den vorherigen Übungen hast du festgestellt, dass alle Elemente des Vektors URLs, den du bekommen hast, den Statuscode 200 zurückgeben. Jetzt, da du weißt, dass sie erreichbar sind, gehst du beim Web Scraping einen Schritt weiter und extrahierst Inhalte.

Dazu verwenden wir Funktionen aus dem Paket rvest, die wir mit partial() vorbefüllen. Die Funktionen, die wir in dieser Übung schreiben, extrahieren alle H2-HTML-Knoten einer Seite — auf einer Webseite entsprechen diese H2-Knoten den Überschriften der Ebene 2. Sobald wir diese Titel extrahiert haben, verwenden wir die Funktion html_text(), um den Textinhalt aus dem rohen HTML herauszuziehen.

purrr und rvest sind für dich geladen, und der Vektor urls steht in deinem Workspace zur Verfügung.

Diese Übung ist Teil des Kurses

<Kurs>Fortgeschrittene funktionale Programmierung mit purrr</Kurs>
Kurs ansehen

Übungsanweisungen

  • Beginne damit, html_nodes() mit css = "h2" vorzufüllen.

  • Kombiniere diese neu erstellte Funktion zwischen read_html und html_text, um einen Textextraktor für H2-Überschriften zu erstellen.

  • Führe diese Funktion auf dem Vektor urls aus und benenne das Ergebnis.

  • Gib das Ergebnis aus, um zu sehen, wie es aussieht.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Prefill html_nodes() with the css param set to h2
get_h2 <- ___(html_nodes, ___)

# Combine the html_text, get_h2 and read_html functions
get_content <- ___(___, ___, ___)

# Map get_content to the urls list
res <- ___(urls, ___) %>%
  set_names(___)

# Print the results to the console
___
Code bearbeiten und ausführen