Blick in den Motorraum

Dieser Vortrag ist passwortgeschützt.

sempercode

GRUNDLAGEN DER KI — MOTORRAUM

Wie Sprachmodelle wirklich funktionieren

Von n-Grammen über Embeddings und LSTM zu Attention und Transformern — ein Blick unter die Haube von LLMs

Frank Farnschläder

DEV-Bootcamp Loberon, 28.09.2026

Zum Mitmachen: die Demos auf dieser Seite sind live — klick dich durch.

01 · AUSGANGSPUNKT

Ein Sprachmodell ist im Kern eine Wahrscheinlichkeitsverteilung über das nächste Token

Trainingskorpus (5 Sätze):

    Sequenz: der — klick auf ein Wort, um es anzuhängen

    02 · N-GRAMM-MODELLE

    Mehr Kontext, schärfere Vorhersage: Tri-, 4- und 5-Gramme

    Das Bigramm sieht nur „der“ — und schlägt „hund“ vor.

    Erst das 5-Gramm unterscheidet hund → straße und katze → matte.

    Der Preis: Dieser Kontext kam im Korpus genau einmal vor.

    02 · N-GRAMM-MODELLE

    Zwei Grenzen, die alles Weitere motivieren

    Begrenzter Kontext

    Auch ein 5-Gramm sieht nur die letzten 4 Wörter. Was davor steht — das Thema, ein Name, der Satz davor — ist für das Modell unsichtbar.

    Sparsity-Problem

    Je länger der Kontext, desto seltener kommt genau diese Wortfolge im Training vor. Ungesehene Folge = keine Vorhersage.

    Wie viele verschiedene Wortfolgen sind bei einem Wortschatz von 50.000 Wörtern möglich?

    2,5 Mrd.

    Folgen aus 2 Wörtern

    125 Billionen

    Folgen aus 3 Wörtern

    3 · 1023

    Folgen aus 5 Wörtern

    Selbst riesige Textsammlungen mit Billionen Wörtern enthalten davon nur einen winzigen Bruchteil — die allermeisten 5-Gramme hat das Modell nie gesehen.

    03 · EMBEDDINGS

    Ein Wort wird zur Zahlenreihe — ähnliche Bedeutung, ähnliche Zahlen

    Spielzeug-Vektoren mit benannten Dimensionen — klick zwei Wörter an, um sie zu vergleichen:

    hund und katze haben fast dieselben Zahlen — das Modell „weiß“, dass sie sich ähneln.

    Das löst das Sparsity-Problem: Was für den Hund gilt, gilt vermutlich auch für die Katze — auch wenn der Satz so nie im Training vorkam.

    Echte Embeddings: 300 (Word2Vec) bis über 12.000 Dimensionen (GPT-3) — ohne Namen, gelernt aus dem Kontext, in dem ein Wort auftaucht.

    03 · EMBEDDINGS

    Rechnen mit Bedeutung: König − Mann + Frau = ?

    Welche Wörter liegen dem Ergebnis am nächsten? (Kosinus-Ähnlichkeit)

    Funktioniert das wirklich?

    Ja — näherungsweise. Gezeigt 2013 mit Word2Vec (Mikolov et al., Google).

    Aber: Das Ergebnis ist nur ein Punkt im Raum. Man sucht das nächstgelegene Wort — und schließt dabei die Eingabewörter aus. Sonst landet man in echten Modellen oft wieder bei „König“.

    Klappt für manche Beziehungen (Geschlecht, Land–Hauptstadt, Zeitformen) — im Test grob die Hälfte bis zwei Drittel der Fälle.

    04 · LSTM

    LSTM: ein neuronales Netz mit Gedächtnis

    Ein rekurrentes Netz (RNN) liest Text Wort für Wort und trägt dabei einen Zustand mit — der Kontext ist nicht mehr auf ein Fenster begrenzt.

    Das Problem: Beim Training verblasst das Signal über viele Schritte (Vanishing Gradient) — das Netz „vergisst“.

    Die Lösung: eine Gedächtniszelle mit drei Gates — Schleusen, die sich je nach Wort mehr oder weniger öffnen. Sie lernen, was gespeichert, behalten und vergessen wird.

    Gedächtnis (Zellzustand) — läuft durch den ganzen Text × + Vergessen Speichern Ausgeben Ausgabe aktuelles Wort (Embedding) + bisheriger Zustand

    1991

    Sepp Hochreiter analysiert in seiner Diplomarbeit an der TU München (Betreuer: Jürgen Schmidhuber), warum rekurrente Netze vergessen

    1997

    Hochreiter & Schmidhuber veröffentlichen das LSTM; das Forget-Gate kommt 2000 hinzu (Gers, Schmidhuber & Cummins)

    2015–16

    Spracherkennung und maschinelle Übersetzung laufen großflächig auf LSTMs, u. a. bei Google

    2024

    xLSTM: Hochreiter (JKU Linz) modernisiert die Idee als Alternative zum Transformer

    04 · LSTM

    Das 5-Gramm vergisst — das LSTM erinnert sich

    5-Gramm: sieht die letzten 4 Wörter

    LSTM-Gedächtnis (vereinfacht dargestellt)

    05 · ATTENTION

    Die Brücke: vom LSTM-Engpass zur Attention

    Vorher: Engpass — der ganze Satz muss in einen einzigen Vektor the cat sits Vektor die Katze sitzt Encoder-LSTM (Englisch) Decoder-LSTM (Deutsch) Mit Attention: bei jedem Wort gezielt zurückschauen die Katze sitzt the cat sits Decoder Eingabesatz

    2014/15

    Attention (Bahdanau, Cho & Bengio): Der Decoder darf bei jedem Wort gezielt auf die relevanten Stellen des Eingabesatzes schauen. Das behebt den Engpass — die eigentliche Geburtsstunde der Attention, damals als Zusatz zu RNNs.

    2016

    Google Neural Machine Translation bringt LSTM plus Attention in Google Translate in den Produktiveinsatz.

    2017

    „Attention Is All You Need“ (Vaswani et al., Google): Der Transformer verzichtet ganz auf LSTMs — nur noch Attention, voll parallel trainierbar. Die Grundlage von GPT & Co.

    Paper lesen ↗ (PDF, öffnet in neuem Tab)

    05 · ATTENTION

    Der Kontext wird dynamisch: jedes Token schaut auf alle anderen

    Klick auf ein Wort im Satz „Die Bank am Fluss war leer“, um es als Query zu setzen.

    Erfunden wurde Attention 2014, um die Schwäche der LSTMs zu beheben: Der Decoder schaute gezielt auf den Eingabesatz zurück. Der Transformer (2017) geht einen Schritt weiter — hier schaut jedes Wort auf alle anderen Wörter im selben Satz (Self-Attention).

    06 · TRANSFORMER

    Der Transformer: Attention im Stapel

    Verteilung fürs nächste Token Feed-Forward (pro Token) Self-Attention (alle Tokens) Embedding + Position Die · Bank · am · Fluss × N Schichten (GPT-3: 96)

    Warum der Durchbruch?

    LSTM●→●→●→●→●→●Wort für Wort, nacheinander
    Transformer● ● ● ● ● ●alle Wörter gleichzeitig

    Beim Training rechnet der Transformer alle Positionen eines Textes parallel — ideal für GPUs. Erst das macht riesige Modelle und Datenmengen praktikabel.

    ModellJahrParameterKontext (Tokens)
    GPT-12018117 Mio.512
    GPT-220191,5 Mrd.1.024
    GPT-32020175 Mrd.2.048
    Llama 3.12024405 Mrd.128.000

    Aktuelle Spitzenmodelle (GPT, Claude, Gemini) nennen ihre Größe nicht; Kontextfenster reichen heute bis über 1 Mio. Tokens.

    06 · TRANSFORMER

    Was steckt im Vektor wirklich?

    Spielzeug (Folie 6):
    7 Zahlen mit Namen
    Lebewesen0,95Mensch0,05Tier0,95männlich0,35weiblich0,20königlich0,00Ort0,10
    Echtes Modell:
    12.288 Zahlen ohne Namen

    Ausschnitt: 300 von 12.288 Werten (GPT-3) — keine einzelne Zahl bedeutet etwas für sich (Illustration)

    Bedeutung ist eine Richtung

    mannfraukönigkönigin „weiblich“„weiblich“

    „Geschlecht“ steckt in keiner einzelnen Zahl, sondern in einer Richtung, an der Tausende Zahlen beteiligt sind. Forscher finden solche Richtungen erst nachträglich — 2024 z. B. eine für die Golden Gate Bridge in Claude.

    Derselbe Vektor — anderer Kontext

    Satz A: „Die Bank am Fluss war leer“ · Satz B: „Er bekam einen Kredit bei der Bank“

    07 · TRAINING

    Training: Billionen Mal das nächste Token raten

    ① Textstück aus dem Korpus„die katze sitzt auf der …“ ② Modell rätstraße 35 % · matte 20 % · … ③ Vergleich mit dem Originalrichtig wäre „matte“ → Fehler(Loss) ④ Gewichte minimal anpassen„matte“ wird wahrscheinlicher(Backpropagation) und wieder

    Beispiel Llama 3.1 405B (Meta, 2024)

    15 Billionen

    Tokens Trainingstext

    16.000

    H100-GPUs parallel

    31 Mio.

    GPU-Stunden ≈ 3.500 Jahre auf einer GPU

    3,8 · 1025

    Rechenoperationen

    Quelle: Meta, „The Llama 3 Herd of Models“ (2024)

    1. Pretraining

    Die Schleife oben — ergibt einen Textvervollständiger. Der größte Teil der Rechenzeit.

    →

    2. Feintuning

    Weitertrainieren mit Beispieldialogen: Frage → gute Antwort.

    →

    3. Präferenz-Training

    Menschen bewerten Antworten, das Modell lernt daraus (RLHF) → Assistent.

    08 · INFERENZ

    Inferenz: das fertige Modell im Einsatz

    Eingabe

    Prompt + bisher erzeugte Tokens

    →

    Modell ❄

    Gewichte eingefroren; ein Durchlauf durch alle Schichten

    →

    Verteilung

    Wahrscheinlichkeit für jedes mögliche Token

    →

    Sampling

    ein Token wählen, anhängen — und von vorn ↺

    Allein die Gewichte müssen in den Speicher:

    405 Mrd. × 2 Byte = 810 GB

    → über 10 GPUs à 80 GB im Rechenzentrum

    8 Mrd. × ½ Byte (4 Bit) = 4 GB

    → läuft auf einem Laptop

    Faustregel: pro erzeugtem Token rund 2 Rechenoperationen je Parameter.

    Kosten pro Token

    APIs rechnen Ein- und Ausgabe-Tokens ab; jedes Token ist ein kompletter Durchlauf.

    Kontext ist teuer

    Der Attention-Aufwand wächst quadratisch mit der Kontextlänge.

    Lernt nicht im Betrieb

    Wissen endet am Trainingsstichtag. Eigenes Wissen kommt per RAG in den Prompt.

    Lokal oder Cloud

    Kleine Modelle lokal (Datenschutz), große nur im Rechenzentrum.

    08 · INFERENZ

    Sampling & Temperature: wie aus Wahrscheinlichkeiten Text wird

    Greedy

    Immer das wahrscheinlichste Token — deterministisch, oft repetitiv.

    Sampling

    Zufallsauswahl nach Wahrscheinlichkeit — Top-k / Top-p begrenzen die Kandidaten.

    Temperature

    Schärft oder glättet die Verteilung — niedrig = konservativ, hoch = kreativ.

    Halluzinationen entstehen genau hier: das Modell wählt eine plausible, aber falsche Fortsetzung — es gibt keinen Wahrheits-Check im Sampling-Schritt.

    ZUSAMMENFASSUNG

    Der rote Faden: immer noch „nächstes Token vorhersagen“

    N-Gramme

    Fester, kurzer Kontext

    →

    Embeddings

    Bedeutung als Vektor

    →

    LSTM

    Gedächtnis, Wort für Wort

    →

    Attention

    Direkter Zugriff auf alles

    →

    Transformer

    Gestapelt, parallel, skalierbar

    →

    Training

    Lernen, dann anwenden (Inferenz)

    Jeder Schritt löst eine Schwäche des vorherigen — das Grundprinzip bleibt gleich.

    sempercode

    DANKE

    Fragen?

    Diese Seite bleibt online — probiert die Demos gern selbst aus.