LoslegenKostenlos starten

Zurück ins Büro

Du arbeitest weiterhin als Data-Analyst:in für eine Webagentur und sollst Web Scraping durchführen. Du hast eine Liste von URLs zur Analyse bekommen – mit der Analyse hast du im vorherigen Kapitel bereits begonnen.

Du gehst davon aus, dass diese Aufgabe regelmäßig wiederkommt: Sehr wahrscheinlich wirst du in ein paar Wochen erneut darum gebeten. Damit dir die Arbeit später leichter fällt, willst du heute sauberen Code schreiben, sodass du später einfacher daran anknüpfen kannst.

Wir beginnen damit, die zwei Funktionen aus httr zu kombinieren, die wir im vorherigen Kapitel gesehen haben: GET() zum Abrufen der Webseite und status_code() zum Auslesen des Statuscodes, um daraus einen Statuscode-Extractor zu bauen.

Der Vektor urls ist weiterhin in deinem Workspace verfügbar. Wir haben nur die URLs beibehalten, die erreichbar sind.

Diese Übung ist Teil des Kurses

<Kurs>Fortgeschrittene funktionale Programmierung mit purrr</Kurs>
Kurs ansehen

Übungsanweisungen

  • Lade purrr und httr.

  • Komponiere einen Status-Extractor mit GET() und status_code().

  • Probiere diese neue Funktion auf "https://www.thinkr.fr" und "https://en.wikipedia.org" aus.

  • Wende diese Funktion direkt auf den Vektor urls an.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Launch purrr and httr



# Compose a status extractor 
status_extract <- ___(___, ___)

# Try with "https://thinkr.fr" & "https://en.wikipedia.org"
___("https://thinkr.fr")
___("https://en.wikipedia.org")

# Map it on the urls vector, return a vector of numbers
___(urls, ___)
Code bearbeiten und ausführen