Gegevens toevoegen aan de collectie
Tijd om die Netflix-films en -series aan je collectie toe te voegen! Je hebt een lijst met document-ID's en teksten gekregen, opgeslagen in respectievelijk ids en documents, die zijn gehaald uit netflix_titles.csv met de volgende code:
ids = []
documents = []
with open('netflix_titles.csv') as csvfile:
reader = csv.DictReader(csvfile)
for i, row in enumerate(reader):
ids.append(row['show_id'])
text = f"Title: {row['title']} ({row['type']})\nDescription: {row['description']}\nCategories: {row['listed_in']}"
documents.append(text)
Als voorbeeld van welke informatie er wordt ge-embed, zie je hier het eerste document uit documents:
Title: Dick Johnson Is Dead (Movie)
Description: As her father nears the end of his life, filmmaker Kirsten Johnson stages his death in inventive and comical ways to help them both face the inevitable.
Categories: Documentaries
Alle benodigde functies en pakketten zijn geïmporteerd en er is een persisterende client gemaakt en toegewezen aan client.
Deze oefening maakt deel uit van de cursus
Introductie tot Embeddings met de OpenAI API
Oefeninstructies
- Maak je
netflix_titles-collectie opnieuw aan. - Voeg de documenten en bijbehorende ID's toe aan de collectie.
- Print het aantal documenten in
collectionen de eerste tien items.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Recreate the netflix_titles collection
collection = client.____(
name="netflix_titles",
embedding_function=OpenAIEmbeddingFunction(model_name="text-embedding-3-small", api_key="")
)
# Add the documents and IDs to the collection
____
# Print the collection size and first ten items
print(f"No. of documents: {____}")
print(f"First ten documents: {____}")