Sémantické rozdělování textu
Všechny strategie rozdělování, které jsi dosud použil/a, mají jednu společnou nevýhodu: při dělení se nebere v úvahu kontext okolního textu, takže ho lze snadno ztratit.
V tomto cvičení vytvoříš a použiješ sémantický text splitter — špičkovou experimentální metodu pro rozdělování textu na základě sémantického významu. Jakmile splitter zjistí, že se význam textu odchýlil za určitou prahovou hodnotu, provede rozdělení.
Toto cvičení je součástí kurzu
Retrieval Augmented Generation (RAG) with LangChain
Pokyny k cvičení
- Vytvoř instanci embedding modelu
'text-embedding-3-small'od OpenAI. - Vytvoř sémantický text splitter, který ke zjišťování sémantické podobnosti používá vektorové gradienty a jako prahovou hodnotu pro rozdělení používá
0.8. - Rozděl
documentpomocí sémantického splitteru.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Instantiate an OpenAI embeddings model
embedding_model = ____(api_key="", model='____')
# Create the semantic text splitter with desired parameters
semantic_splitter = ____(
embeddings=____, breakpoint_threshold_type="____", breakpoint_threshold_amount=____
)
# Split the document
chunks = ____
print(chunks[0])