Začněte nyníZačněte zdarma

Sémantické rozdělování textu

Všechny strategie rozdělování, které jsi dosud použil/a, mají jednu společnou nevýhodu: při dělení se nebere v úvahu kontext okolního textu, takže ho lze snadno ztratit.

V tomto cvičení vytvoříš a použiješ sémantický text splitter — špičkovou experimentální metodu pro rozdělování textu na základě sémantického významu. Jakmile splitter zjistí, že se význam textu odchýlil za určitou prahovou hodnotu, provede rozdělení.

Toto cvičení je součástí kurzu

Retrieval Augmented Generation (RAG) with LangChain

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř instanci embedding modelu 'text-embedding-3-small' od OpenAI.
  • Vytvoř sémantický text splitter, který ke zjišťování sémantické podobnosti používá vektorové gradienty a jako prahovou hodnotu pro rozdělení používá 0.8.
  • Rozděl document pomocí sémantického splitteru.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Instantiate an OpenAI embeddings model
embedding_model = ____(api_key="", model='____')

# Create the semantic text splitter with desired parameters
semantic_splitter = ____(
    embeddings=____, breakpoint_threshold_type="____", breakpoint_threshold_amount=____
)

# Split the document
chunks = ____
print(chunks[0])
Upravit a spustit kód