LoslegenKostenlos starten

Nullen hinzufügen

Viele Empfehlungssysteme verwenden implizite Bewertungen. In vielen Fällen enthalten diese Datensätze keine Verhaltenszählungen für Artikel, die ein Nutzer noch nie gekauft hat. In solchen Fällen musst du sie ergänzen und Nullen aufnehmen. Das DataFrame Z ist für dich bereitgestellt. Es enthält userIds, productIds und num_purchases, also die Anzahl der Käufe eines bestimmten Produkts durch einen Nutzer.

Diese Übung ist Teil des Kurses

<Kurs>Recommendation Engines mit PySpark erstellen</Kurs>
Kurs ansehen

Übungsanweisungen

  • Schau dir das DataFrame Z mit der Methode .show() an.
  • Extrahiere die unterschiedlichen userIds und productIds aus Z mit der Methode .distinct(). Nenne die Ergebnisse entsprechend users und products.
  • Führe ein .crossJoin() auf den DataFrames users und products aus. Nenne das Ergebnis cj.
  • Führe einen "left"-Join von cj mit dem ursprünglichen Ratings-DataFrame Z auf ["userId", "productId"] aus. Rufe auf dem Ergebnis die Methode .fillna(0) auf, um die Lücken mit Nullen zu füllen. Nenne das Ergebnis Z_expanded.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# View the data
Z.____()

# Extract distinct userIds and productIds
users = ____.select("____").____()
products = Z.____("productId").____()

# Cross join users and products
____ = users.____(products)

# Join cj and Z
____ = cj.join(Z, ["____", "____"], "left").____(0)

# View Z_expanded
____.show()
Code bearbeiten und ausführen