Den Transformer zerlegen
Die Transformer-Architektur hat das Sequenzmodellieren revolutioniert und viele Fortschritte im Deep Learning integriert, wie z. B. Positionskodierung, Aufmerksamkeitsmechanismen und vieles mehr.
Welche Komponente der Transformer-Architektur ist dafür verantwortlich, Informationen über die Position jedes Tokens in der Sequenz zu erfassen?
Diese Übung ist Teil des Kurses
<Kurs>Transformer-Modelle mit PyTorch</Kurs>Interaktive praktische Übung
Verwandle Theorie mit einer unserer interaktiven Übungen in die Praxis
Übung starten