CommencezCommencez gratuitement

Découpage sémantique

Toutes les stratégies de découpage que vous avez utilisées jusqu'ici ont le même inconvénient : elles ne tiennent pas compte du contexte entourant le texte, ce qui peut facilement entraîner une perte de contexte au moment du découpage.

Dans cet exercice, vous allez créer et appliquer un découpeur sémantique de texte, une méthode expérimentale de pointe qui segmente le texte selon son sens. Lorsque le découpeur détecte que le sens du texte dépasse un certain seuil, il effectue une coupure.

Cette activité fait partie du cours

Retrieval Augmented Generation (RAG) avec LangChain

Voir le cours

Instructions de l’exercice

  • Instanciez le modèle d'intégration 'text-embedding-3-small' d'OpenAI.
  • Créez un découpeur sémantique de texte qui utilise des gradients de vecteurs pour déterminer la similarité sémantique et qui emploie 0.8 comme seuil de coupure.
  • Découpez le document à l'aide du découpeur sémantique.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Instantiate an OpenAI embeddings model
embedding_model = ____(api_key="", model='____')

# Create the semantic text splitter with desired parameters
semantic_splitter = ____(
    embeddings=____, breakpoint_threshold_type="____", breakpoint_threshold_amount=____
)

# Split the document
chunks = ____
print(chunks[0])
Modifier et exécuter le code