Dieser Vortrag ist passwortgeschützt.
GRUNDLAGEN DER KI — MOTORRAUM
Von n-Grammen über Embeddings und LSTM zu Attention und Transformern — ein Blick unter die Haube von LLMs
Frank Farnschläder
DEV-Bootcamp Loberon, 28.09.2026
Zum Mitmachen: die Demos auf dieser Seite sind live — klick dich durch.
01 · AUSGANGSPUNKT
Sequenz: der — klick auf ein Wort, um es anzuhängen
01
02 · N-GRAMM-MODELLE
Das Bigramm sieht nur „der“ — und schlägt „hund“ vor.
Erst das 5-Gramm unterscheidet hund → straße und katze → matte.
Der Preis: Dieser Kontext kam im Korpus genau einmal vor.
02
02 · N-GRAMM-MODELLE
Auch ein 5-Gramm sieht nur die letzten 4 Wörter. Was davor steht — das Thema, ein Name, der Satz davor — ist für das Modell unsichtbar.
Je länger der Kontext, desto seltener kommt genau diese Wortfolge im Training vor. Ungesehene Folge = keine Vorhersage.
Wie viele verschiedene Wortfolgen sind bei einem Wortschatz von 50.000 Wörtern möglich?
2,5 Mrd.
Folgen aus 2 Wörtern
125 Billionen
Folgen aus 3 Wörtern
3 · 1023
Folgen aus 5 Wörtern
Selbst riesige Textsammlungen mit Billionen Wörtern enthalten davon nur einen winzigen Bruchteil — die allermeisten 5-Gramme hat das Modell nie gesehen.
03
03 · EMBEDDINGS
Spielzeug-Vektoren mit benannten Dimensionen — klick zwei Wörter an, um sie zu vergleichen:
hund und katze haben fast dieselben Zahlen — das Modell „weiß“, dass sie sich ähneln.
Das löst das Sparsity-Problem: Was für den Hund gilt, gilt vermutlich auch für die Katze — auch wenn der Satz so nie im Training vorkam.
Echte Embeddings: 300 (Word2Vec) bis über 12.000 Dimensionen (GPT-3) — ohne Namen, gelernt aus dem Kontext, in dem ein Wort auftaucht.
04
03 · EMBEDDINGS
Welche Wörter liegen dem Ergebnis am nächsten? (Kosinus-Ähnlichkeit)
Ja — näherungsweise. Gezeigt 2013 mit Word2Vec (Mikolov et al., Google).
Aber: Das Ergebnis ist nur ein Punkt im Raum. Man sucht das nächstgelegene Wort — und schließt dabei die Eingabewörter aus. Sonst landet man in echten Modellen oft wieder bei „König“.
Klappt für manche Beziehungen (Geschlecht, Land–Hauptstadt, Zeitformen) — im Test grob die Hälfte bis zwei Drittel der Fälle.
05
04 · LSTM
Ein rekurrentes Netz (RNN) liest Text Wort für Wort und trägt dabei einen Zustand mit — der Kontext ist nicht mehr auf ein Fenster begrenzt.
Das Problem: Beim Training verblasst das Signal über viele Schritte (Vanishing Gradient) — das Netz „vergisst“.
Die Lösung: eine Gedächtniszelle mit drei Gates — Schleusen, die sich je nach Wort mehr oder weniger öffnen. Sie lernen, was gespeichert, behalten und vergessen wird.
1991
Sepp Hochreiter analysiert in seiner Diplomarbeit an der TU München (Betreuer: Jürgen Schmidhuber), warum rekurrente Netze vergessen
1997
Hochreiter & Schmidhuber veröffentlichen das LSTM; das Forget-Gate kommt 2000 hinzu (Gers, Schmidhuber & Cummins)
2015–16
Spracherkennung und maschinelle Übersetzung laufen großflächig auf LSTMs, u. a. bei Google
2024
xLSTM: Hochreiter (JKU Linz) modernisiert die Idee als Alternative zum Transformer
06
04 · LSTM
07
05 · ATTENTION
2014/15
Attention (Bahdanau, Cho & Bengio): Der Decoder darf bei jedem Wort gezielt auf die relevanten Stellen des Eingabesatzes schauen. Das behebt den Engpass — die eigentliche Geburtsstunde der Attention, damals als Zusatz zu RNNs.
2016
Google Neural Machine Translation bringt LSTM plus Attention in Google Translate in den Produktiveinsatz.
2017
„Attention Is All You Need“ (Vaswani et al., Google): Der Transformer verzichtet ganz auf LSTMs — nur noch Attention, voll parallel trainierbar. Die Grundlage von GPT & Co.
Paper lesen ↗ (PDF, öffnet in neuem Tab)
08
05 · ATTENTION
Klick auf ein Wort im Satz „Die Bank am Fluss war leer“, um es als Query zu setzen.
Erfunden wurde Attention 2014, um die Schwäche der LSTMs zu beheben: Der Decoder schaute gezielt auf den Eingabesatz zurück. Der Transformer (2017) geht einen Schritt weiter — hier schaut jedes Wort auf alle anderen Wörter im selben Satz (Self-Attention).
09
06 · TRANSFORMER
Beim Training rechnet der Transformer alle Positionen eines Textes parallel — ideal für GPUs. Erst das macht riesige Modelle und Datenmengen praktikabel.
| Modell | Jahr | Parameter | Kontext (Tokens) |
|---|---|---|---|
| GPT-1 | 2018 | 117 Mio. | 512 |
| GPT-2 | 2019 | 1,5 Mrd. | 1.024 |
| GPT-3 | 2020 | 175 Mrd. | 2.048 |
| Llama 3.1 | 2024 | 405 Mrd. | 128.000 |
Aktuelle Spitzenmodelle (GPT, Claude, Gemini) nennen ihre Größe nicht; Kontextfenster reichen heute bis über 1 Mio. Tokens.
10
06 · TRANSFORMER
Ausschnitt: 300 von 12.288 Werten (GPT-3) — keine einzelne Zahl bedeutet etwas für sich (Illustration)
„Geschlecht“ steckt in keiner einzelnen Zahl, sondern in einer Richtung, an der Tausende Zahlen beteiligt sind. Forscher finden solche Richtungen erst nachträglich — 2024 z. B. eine für die Golden Gate Bridge in Claude.
Satz A: „Die Bank am Fluss war leer“ · Satz B: „Er bekam einen Kredit bei der Bank“
11
07 · TRAINING
Beispiel Llama 3.1 405B (Meta, 2024)
15 Billionen
Tokens Trainingstext
16.000
H100-GPUs parallel
31 Mio.
GPU-Stunden ≈ 3.500 Jahre auf einer GPU
3,8 · 1025
Rechenoperationen
Quelle: Meta, „The Llama 3 Herd of Models“ (2024)
Die Schleife oben — ergibt einen Textvervollständiger. Der größte Teil der Rechenzeit.
Weitertrainieren mit Beispieldialogen: Frage → gute Antwort.
Menschen bewerten Antworten, das Modell lernt daraus (RLHF) → Assistent.
12
08 · INFERENZ
Prompt + bisher erzeugte Tokens
Gewichte eingefroren; ein Durchlauf durch alle Schichten
Wahrscheinlichkeit für jedes mögliche Token
ein Token wählen, anhängen — und von vorn ↺
Allein die Gewichte müssen in den Speicher:
405 Mrd. × 2 Byte = 810 GB
→ über 10 GPUs à 80 GB im Rechenzentrum
8 Mrd. × ½ Byte (4 Bit) = 4 GB
→ läuft auf einem Laptop
Faustregel: pro erzeugtem Token rund 2 Rechenoperationen je Parameter.
APIs rechnen Ein- und Ausgabe-Tokens ab; jedes Token ist ein kompletter Durchlauf.
Der Attention-Aufwand wächst quadratisch mit der Kontextlänge.
Wissen endet am Trainingsstichtag. Eigenes Wissen kommt per RAG in den Prompt.
Kleine Modelle lokal (Datenschutz), große nur im Rechenzentrum.
13
08 · INFERENZ
Immer das wahrscheinlichste Token — deterministisch, oft repetitiv.
Zufallsauswahl nach Wahrscheinlichkeit — Top-k / Top-p begrenzen die Kandidaten.
Schärft oder glättet die Verteilung — niedrig = konservativ, hoch = kreativ.
Halluzinationen entstehen genau hier: das Modell wählt eine plausible, aber falsche Fortsetzung — es gibt keinen Wahrheits-Check im Sampling-Schritt.
14
ZUSAMMENFASSUNG
Fester, kurzer Kontext
Bedeutung als Vektor
Gedächtnis, Wort für Wort
Direkter Zugriff auf alles
Gestapelt, parallel, skalierbar
Lernen, dann anwenden (Inferenz)
Jeder Schritt löst eine Schwäche des vorherigen — das Grundprinzip bleibt gleich.
15
DANKE
Diese Seite bleibt online — probiert die Demos gern selbst aus.