De uitvoertekst voorbereiden

In deze oefening bereid je de uitvoerteksten voor die in het vertaalmodel worden gebruikt. Naast het omzetten van tekst naar reeksen indexen, moet je ook elke index one-hot encoden.

De Engelse teksten zijn geladen in de variabele en_sentences, de getrainde tokenizer in de variabele output_tokenizer en de grootte van de Engelse woordenschat in en_vocab_size.

Er is ook al een functie gemaakt om de eerste stappen van de transformatie van de doeltaal uit te voeren (het omzetten van teksten naar reeksen indexen). De functie is in de omgeving geladen als transform_text_to_sequences() en heeft twee parameters: sentences, waarin een lijst met Engelse zinnen wordt verwacht, en tokenizer, waarin een getraind Tokenizer-object uit de module keras.preprocessing.text wordt verwacht.

numpy is geladen als np.

Deze oefening maakt deel uit van de cursus

Recurrent Neural Networks (RNN's) voor taalmodellen met Keras

Oefeninstructies

Geef de variabelen en_sentences en output_tokenizer door aan de functie transform_text_to_sequences() om de variabele Y te initialiseren.
Gebruik de functie to_categorical() om de zinnen one-hot te encoden. Gebruik de variabele en_vocab_size als aantal klassen.
Zet de tijdelijke lijst om naar een numpy-array en reshape deze naar de vorm (num_sentences, sentences_len, en_vocab_size).
Print de ruwe tekst en de getransformeerde versie.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Initialize the variable
Y = transform_text_to_sequences(____, ____)

# Temporary list
ylist = list()
for sequence in Y:
  	# One-hot encode sentence and append to list
    ylist.append(____(sequence, num_classes=____))

# Update the variable
Y = np.array(ylist).reshape(____, Y.shape[1], en_vocab_size)

# Print the raw sentence and its transformed version
print("Raw sentence: {0}\nTransformed: {1}".format(____, Y[0]))

Code bewerken en uitvoeren

Deze oefening maakt deel uit van de cursus

Recurrent Neural Networks (RNN's) voor taalmodellen met Keras

SkillTag.level.advancedSkillTag.label

4.8+

Begin gratis met de cursus

In dit hoofdstuk leer je de basis van Recurrent Neural Networks (RNN). We beginnen met enkele vereisten, bekijken hoe informatie door het netwerk stroomt en laten tot slot zien hoe je zulke modellen met Keras implementeert voor een taak in sentimentclassificatie.

Exercise 1: Introductie van de cursus Exercise 2: Het aantal parameters van RNN en ANN vergelijken Exercise 3: Sentimentanalyse Exercise 4: Sequence-to-sequence-modellen Exercise 5: Introductie tot taalmodellen Exercise 6: Wennen aan tekstdata Exercise 7: Tekstgegevens voorbereiden voor modelinvoer Exercise 8: Nieuwe tekst transformeren Exercise 9: Introductie tot RNN in Keras Exercise 10: Keras-modellen Exercise 11: Keras-preprocessing Exercise 12: Je eerste RNN-model

Je leert over het vanishing- en exploding-gradient-probleem, dat vaak voorkomt bij RNN's, en hoe je dit aanpakt met GRU- en LSTM-cellen. Verder maak je embedding-lagen voor taalmodellen en pak je de taak van sentimentclassificatie opnieuw op.

Exercise 1: Ver verdwijnende en exploderende gradiënten Exercise 2: Exploding gradient-probleem Exercise 3: Vanishing gradient-probleem Exercise 4: GRU- en LSTM-cellen Exercise 5: GRU-cellen zijn beter dan SimpleRNN Exercise 6: RNN-lagen stapelen Exercise 7: De Embedding-laag Exercise 8: Vergelijking van het aantal parameters Exercise 9: Transfer learning Exercise 10: Embeddings verbeteren de prestaties Exercise 11: Sentimentclassificatie herbekeken Exercise 12: Betere sentimentclassificatie Exercise 13: De CNN-laag gebruiken

Vervolgens leer je in dit hoofdstuk hoe je data voorbereidt voor een multiclass-classificatietaak, en wat de verschillen zijn tussen multiclass-classificatie en binaire classificatie (sentimentanalyse). Tot slot leer je hoe je modellen bouwt en hun prestaties meet met Keras.

Exercise 1: Data preprocessing Exercise 2: Labelvectoren voorbereiden Exercise 3: Data pre-processen Exercise 4: Transfer learning voor taalmodellen Exercise 5: Startpunt voor transfer learning Exercise 6: Word2Vec Exercise 7: Modellen voor multiclass-classificatie Exercise 8: De 20 Newsgroups-gegevensset verkennen Exercise 9: Nieuwsartikelen classificeren Exercise 10: De prestatie van het model beoordelen Exercise 11: Trade-off tussen precisie en recall Exercise 12: Precision of Recall, dát is de vraag Exercise 13: Prestaties bij multi-class classificatie

Dit hoofdstuk introduceert twee toepassingen van RNN-modellen: tekstgeneratie en Neural Machine Translation. Je leert hoe je de tekstdata voorbereidt in het formaat dat de modellen nodig hebben. Het tekstgeneratiemodel wordt gebruikt om de manier van spreken van een personage na te bootsen en we hebben wat lol met het imiteren van Sheldon uit The Big Bang Theory. Neural Machine Translation wordt bijvoorbeeld door Google Translate gebruikt in een veel complexer model. In dit hoofdstuk maak je een model dat korte Portugese zinnen naar het Engels vertaalt.

Exercise 1: Sequence-to-sequence-modellen Exercise 2: Voorbeelden van tekstgeneratie Exercise 3: NMT-voorbeeld Exercise 4: De tekstgeneratiefunctie Exercise 5: Voorspel het volgende teken Exercise 6: Genereer zin met context Exercise 7: Pas de waarschijnlijkheidsschaal aan Exercise 8: Modellen voor tekengeneratie Exercise 9: Maak vectoren van zinnen en volgende tekens Exercise 10: De data voorbereiden voor training Exercise 11: Het tekstgeneratiemodel maken Exercise 12: Neurale machinevertaling Exercise 13: De invoertekst voorbereiden Exercise 14: De uitvoertekst voorbereiden

Huidige oefening

Exercise 15: Vertaal Portugees naar Engels Exercise 16: Gefeliciteerd!