15–20 J
📖 Page 05 von 8 · ~35 Min

LLMs: wie ChatGPT denkt 💬

Du redest täglich mit ChatGPT, Claude, Gemini — aber was passiert da eigentlich unter der Haube? Auf dieser Page entzaubern wir es: Tokens, Transformer, Attention, Pretraining, RLHF. Plus Prompt-Engineering, das tatsächlich funktioniert. Achtung: nach dieser Page guckst du LLMs nie wieder gleich an.

🔡 Tokens, nicht Buchstaben 🎯 Attention is all you need 🎓 RLHF & Fine-Tuning
"Wie geht es..." Wie geht es ... TRANSFORMER "...dir denn?"

01Was ist ein LLM in einem Satz?

Spoiler: es ist nicht denken. Es ist Vorhersage.

Ein LLM (Large Language Model) sagt das wahrscheinlichste nächste Token voraus — basierend auf allem, was bisher im Text steht. Das war's. Das ist das ganze Geheimnis.

Klingt simpel? Ist es auch. Das Erstaunliche ist nur, dass dieser eine Trick — wieder und wieder Token für Token — am Ende plötzlich aussieht wie echtes Denken: Code schreiben, Aufgaben lösen, Witze machen, übersetzen. Niemand hat das so erwartet, als die Forscher das anfingen.

Bei ChatGPT: du tippst eine Frage → das Modell tokenisiert sie → für jedes neue Wort, das es generiert, rechnet es Millionen mal: „welches Token ist nach all dem hier am wahrscheinlichsten?" → wählt eines → hängt es an → wiederholt. Wort für Wort, bis ein „Stop"-Token kommt.

🤓
Mentales Modell: Stell dir vor du musst einen Satz vervollständigen. „Der Apfel fällt vom ..." → dein Hirn ratet sofort „Baum". Ein LLM macht exakt das, nur dass es Trillionen Sätze gelesen hat und seine Ratschläge daher sehr gut sind. Es weiss eigentlich nichts — es errät.

02Live-Demo: Tokens & nächste Vorhersage 🔡

LLMs sehen keine Buchstaben oder Wörter — sie sehen „Tokens". Tipp einen Satz, beobachte wie er zerlegt wird. Unten siehst du, was das Modell als nächstes Token vorschlagen würde:

Zeichen
36
Tokens (~)
11
Cost (GPT-4)
$0.0001

🎯 Mögliche nächste Tokens

Lunolabs ist ein Lab für junge Maker

Diese Wahrscheinlichkeiten sind hier vereinfacht & simuliert. Ein echtes LLM würde aus ~50000 möglichen Tokens auswählen.

🧮
Faustregel: 1 Token ≈ 4 Zeichen auf Englisch, ~3 Zeichen auf Deutsch. „Hello world!" = 3 Tokens. „Ausserordentlich" = ~5 Tokens. Bei langen Texten oder Code wird's mehr. API-Kosten rechnen alle pro Token — schau auf platform.openai.com/tokenizer, um exakte Counts zu sehen.

03Attention: das Herz der Transformer 🎯

2017 erschien das Paper „Attention Is All You Need" — und alles, was du heute als „AI" kennst, baut darauf auf. Was ist Attention?

Idee in einem Satz: Für jedes Token im Input rechnet das Modell aus, wie stark es auf jedes andere Token „achten" soll, um den Kontext zu verstehen.

Beispiel: „Der Hund jagt die Katze, die schlief." Wenn das Modell „die" (das zweite) verarbeitet, muss es wissen, dass „die" auf „Katze" zurückzeigt, nicht auf „Hund". Attention erlaubt das — es richtet Aufmerksamkeit explizit auf das richtige frühere Token.

🔑 Self-Attention

Jedes Token schaut auf alle anderen Tokens im selben Text. So baut das Modell Beziehungen auf — Subjekt-Verb, Pronomen-Bezug, lange Distanzen.

📊 Multi-Head

Mehrere Attention-„Köpfe" parallel — jeder spezialisiert auf eine andere Art Beziehung (z.B. Syntax, Semantik, Position).

🪢 Self vs Cross

Self-Attention: Tokens vs sich selbst. Cross-Attention: zwischen Encoder + Decoder (z.B. Übersetzung Englisch → Deutsch).

📐 QKV-Math

Drei Matrizen — Query, Key, Value. Q × Kᵀ = Score. Softmax → Attention-Gewichte. Mit Value-Matrix multipliziert → Output.

🤔
Warum revolutionär? Vor 2017 waren Sprach-Modelle „rekurrent" (RNN/LSTM) — sie verarbeiteten Tokens sequentiell, eines nach dem anderen. Langsam, vergessen Sachen. Transformer verarbeiten alle Tokens parallel — riesig schneller auf GPUs und besser im Kontext-Aufbauen. Daher konnten plötzlich 100×-grössere Modelle trainiert werden — und plötzlich begannen sie zu „denken".

04Wie ein LLM trainiert wird: 3 Stages

ChatGPT entsteht nicht in einem Schritt. Es sind drei sehr verschiedene Trainings-Phasen:

STAGE 1

Pretraining

Modell liest das gesamte Internet (Bücher, Web, Code, etc.) und lernt nur eines: das nächste Token vorhersagen. Dauert Monate auf tausenden GPUs. Kosten: $50M–$500M.

STAGE 2

Supervised Fine-Tuning

Menschen schreiben tausende Beispiel-Dialoge (gute Frage → gute Antwort). Modell lernt, in dieser Form zu antworten. Hier wird aus „Text-Vervollständiger" ein „Chatbot".

STAGE 3

RLHF

„Reinforcement Learning from Human Feedback". Menschen bewerten Antworten (👍/👎). Das Modell lernt, was Menschen mögen — höflich sein, keine schädlichen Antworten geben, hilfreich sein.

💰
Money Talk: GPT-4 zu trainieren hat angeblich ~$100M gekostet. Llama 3 ~$50M. Claude 3 Opus geschätzt ähnlich. Aber das Inferenz-Training (Stage 2+3) ist viel billiger — du kannst Open-Source-Basis-Modelle (Llama, Mistral) selbst feintunen für unter $1000.

05Prompt-Engineering: was wirklich funktioniert

Du kannst ein LLM nicht „programmieren" wie eine Funktion — aber du kannst gute Prompts schreiben, die ganz unterschiedlich gute Ergebnisse liefern.

❌ Schlecht: Vage

Schreib einen Aufsatz
über AI

✅ Besser: Spezifisch + Rolle

Du bist Lehrer für Sek 1.
Schreib einen 300-Wort-
Aufsatz über AI, Tonalität
freundlich, mit 3 Beispielen
aus dem Alltag.

❌ Schlecht: Ohne Beispiele

Übersetze ins Schweizerdeutsch:
"Wo ist der Bahnhof?"

✅ Besser: Few-Shot

Übersetze ins Züri-Dialekt:
"Guten Tag" → "Grüezi mitenand"
"Wie geht's?" → "Wie häsches?"
"Auf Wiedersehen" → "Uf Widerluege"
"Wo ist der Bahnhof?" → ?

❌ Schlecht: Keine Struktur

Mach mir einen Lernplan

✅ Besser: Format vorgeben

Erstelle einen 7-Tage-Lernplan für
JavaScript-Anfänger. Output als
Markdown-Tabelle mit Spalten:
Tag, Topic, Übung, Dauer (Min).

🎯 Top-Trick: Chain-of-Thought

Aufgabe: Wenn Anna 3 Äpfel hat
und Tim ihr 5 gibt, dann isst sie 2,
wieviele bleiben?

Denke Schritt für Schritt.
🧠
5 Goldene Regeln: 1) Sei spezifisch (Zielgruppe, Länge, Format). 2) Gib Rolle („Du bist Mathelehrer"). 3) Few-Shot-Examples wenn du ein bestimmtes Format willst. 4) „Denke Schritt für Schritt" für Mathe / Logik. 5) Iterier — der erste Prompt ist selten der beste.

06Proprietary vs Open-Source LLMs

Zwei Welten — beide haben ihren Platz. Was wann nehmen?

ModellAnbieterTypStärkeNutzung
GPT-5 OpenAI Closed Allround, sehr stark API + ChatGPT
Claude 4.6 Anthropic Closed Code, lange Kontexte API + Claude.ai
Gemini 2.5 Google Closed Multi-modal, Vision API + Workspace
Llama 4 Meta 🌍 Open-Weight Selbst-hostbar, gratis Ollama, vLLM, lokal
Mistral / Mixtral Mistral AI 🇫🇷 🌍 Open-Weight Klein + effizient Edge-Devices, Embedded
DeepSeek V3 DeepSeek 🇨🇳 🌍 Open-Weight Open + Top-Performance Lokal · CFL
🤝
Lab-Strategie: Lernen + Prototyping → API von OpenAI/Anthropic (schnell + leistungsfähig). Eigenes Projekt das lokal laufen muss / Privacy-Anforderung → Ollama mit Llama 3 oder Mistral auf deinem Laptop oder RPi 5. Beides geht zusammen: API für Hauptarbeit, lokal für sensible Daten.

🎯Key Takeaways aus Page 05