Découpage sémantique
Toutes les stratégies de découpage que vous avez utilisées jusqu'ici ont le même inconvénient : elles ne tiennent pas compte du contexte entourant le texte, ce qui peut facilement entraîner une perte de contexte au moment du découpage.
Dans cet exercice, vous allez créer et appliquer un découpeur sémantique de texte, une méthode expérimentale de pointe qui segmente le texte selon son sens. Lorsque le découpeur détecte que le sens du texte dépasse un certain seuil, il effectue une coupure.
Cette activité fait partie du cours
Retrieval Augmented Generation (RAG) avec LangChain
Instructions de l’exercice
- Instanciez le modèle d'intégration
'text-embedding-3-small'd'OpenAI. - Créez un découpeur sémantique de texte qui utilise des gradients de vecteurs pour déterminer la similarité sémantique et qui emploie
0.8comme seuil de coupure. - Découpez le
documentà l'aide du découpeur sémantique.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Instantiate an OpenAI embeddings model
embedding_model = ____(api_key="", model='____')
# Create the semantic text splitter with desired parameters
semantic_splitter = ____(
embeddings=____, breakpoint_threshold_type="____", breakpoint_threshold_amount=____
)
# Split the document
chunks = ____
print(chunks[0])