Nieuwe tekst transformeren

In deze oefening transformeer je een nieuwe tekst naar reeksen numerieke indexen op basis van de eerder gemaakte dictionaries.

Dit is handig wanneer je al een getraind model hebt en het wilt toepassen op een nieuwe gegevensset. De voorbewerking die je op de trainingsgegevens hebt gedaan, moet je ook toepassen op de nieuwe tekst, zodat het model voorspellingen/classificaties kan maken.

Hier gebruik je ook een speciaal token '<UKN/>' om woorden weer te geven die niet in de woordenschat voorkomen. Doorgaans zijn dit soort speciale tokens de eerste indexen van de dictionaries, dus positie 0.

De variabelen word_to_index, index_to_word en vocabulary zijn al in de omgeving geladen. Ook de variabele met de nieuwe tekst is geladen als new_text. De nieuwe tekst is voor je afgedrukt zodat je ernaar kunt kijken.

Deze oefening maakt deel uit van de cursus

Recurrent Neural Networks (RNN's) voor taalmodellen met Keras

Oefeninstructies

Loop door de lijst new_text met de zinnen.
Stel de index in op 0 als het woord niet in de dictionary wordt gevonden.
Voeg de zin met indexen toe aan de variabele new_text_split.
Zet de indexen terug om naar tekst met de dictionary index_to_word.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Loop through the sentences and get indexes
new_text_split = []
for sentence in ____:
    sent_split = []
    for wd in sentence.split(' '):
        index = word_to_index.get(wd, ____)
        sent_split.append(index)
    new_text_split.append(____)

# Print the first sentence's indexes
print(new_text_split[0])

# Print the sentence converted using the dictionary
print(' '.join([index_to_word[____] for index in new_text_split[0]]))

Code bewerken en uitvoeren

Deze oefening maakt deel uit van de cursus

Recurrent Neural Networks (RNN's) voor taalmodellen met Keras

SkillTag.level.advancedSkillTag.label

4.8+

Begin gratis met de cursus

In dit hoofdstuk leer je de basis van Recurrent Neural Networks (RNN). We beginnen met enkele vereisten, bekijken hoe informatie door het netwerk stroomt en laten tot slot zien hoe je zulke modellen met Keras implementeert voor een taak in sentimentclassificatie.

Exercise 1: Introductie van de cursus Exercise 2: Het aantal parameters van RNN en ANN vergelijken Exercise 3: Sentimentanalyse Exercise 4: Sequence-to-sequence-modellen Exercise 5: Introductie tot taalmodellen Exercise 6: Wennen aan tekstdata Exercise 7: Tekstgegevens voorbereiden voor modelinvoer Exercise 8: Nieuwe tekst transformeren

Huidige oefening

Exercise 9: Introductie tot RNN in Keras Exercise 10: Keras-modellen Exercise 11: Keras-preprocessing Exercise 12: Je eerste RNN-model

Je leert over het vanishing- en exploding-gradient-probleem, dat vaak voorkomt bij RNN's, en hoe je dit aanpakt met GRU- en LSTM-cellen. Verder maak je embedding-lagen voor taalmodellen en pak je de taak van sentimentclassificatie opnieuw op.

Exercise 1: Ver verdwijnende en exploderende gradiënten Exercise 2: Exploding gradient-probleem Exercise 3: Vanishing gradient-probleem Exercise 4: GRU- en LSTM-cellen Exercise 5: GRU-cellen zijn beter dan SimpleRNN Exercise 6: RNN-lagen stapelen Exercise 7: De Embedding-laag Exercise 8: Vergelijking van het aantal parameters Exercise 9: Transfer learning Exercise 10: Embeddings verbeteren de prestaties Exercise 11: Sentimentclassificatie herbekeken Exercise 12: Betere sentimentclassificatie Exercise 13: De CNN-laag gebruiken

Vervolgens leer je in dit hoofdstuk hoe je data voorbereidt voor een multiclass-classificatietaak, en wat de verschillen zijn tussen multiclass-classificatie en binaire classificatie (sentimentanalyse). Tot slot leer je hoe je modellen bouwt en hun prestaties meet met Keras.

Exercise 1: Data preprocessing Exercise 2: Labelvectoren voorbereiden Exercise 3: Data pre-processen Exercise 4: Transfer learning voor taalmodellen Exercise 5: Startpunt voor transfer learning Exercise 6: Word2Vec Exercise 7: Modellen voor multiclass-classificatie Exercise 8: De 20 Newsgroups-gegevensset verkennen Exercise 9: Nieuwsartikelen classificeren Exercise 10: De prestatie van het model beoordelen Exercise 11: Trade-off tussen precisie en recall Exercise 12: Precision of Recall, dát is de vraag Exercise 13: Prestaties bij multi-class classificatie

Dit hoofdstuk introduceert twee toepassingen van RNN-modellen: tekstgeneratie en Neural Machine Translation. Je leert hoe je de tekstdata voorbereidt in het formaat dat de modellen nodig hebben. Het tekstgeneratiemodel wordt gebruikt om de manier van spreken van een personage na te bootsen en we hebben wat lol met het imiteren van Sheldon uit The Big Bang Theory. Neural Machine Translation wordt bijvoorbeeld door Google Translate gebruikt in een veel complexer model. In dit hoofdstuk maak je een model dat korte Portugese zinnen naar het Engels vertaalt.

Exercise 1: Sequence-to-sequence-modellen Exercise 2: Voorbeelden van tekstgeneratie Exercise 3: NMT-voorbeeld Exercise 4: De tekstgeneratiefunctie Exercise 5: Voorspel het volgende teken Exercise 6: Genereer zin met context Exercise 7: Pas de waarschijnlijkheidsschaal aan Exercise 8: Modellen voor tekengeneratie Exercise 9: Maak vectoren van zinnen en volgende tekens Exercise 10: De data voorbereiden voor training Exercise 11: Het tekstgeneratiemodel maken Exercise 12: Neurale machinevertaling Exercise 13: De invoertekst voorbereiden Exercise 14: De uitvoertekst voorbereiden Exercise 15: Vertaal Portugees naar Engels Exercise 16: Gefeliciteerd!