LLMs: wie ChatGPT denkt 💬
Du redest täglich mit ChatGPT, Claude, Gemini — aber was passiert da eigentlich unter der Haube? Auf dieser Page entzaubern wir es: Tokens, Transformer, Attention, Pretraining, RLHF. Plus Prompt-Engineering, das tatsächlich funktioniert. Achtung: nach dieser Page guckst du LLMs nie wieder gleich an.
01Was ist ein LLM in einem Satz?
Spoiler: es ist nicht denken. Es ist Vorhersage.
Ein LLM (Large Language Model) sagt das wahrscheinlichste nächste Token voraus — basierend auf allem, was bisher im Text steht. Das war's. Das ist das ganze Geheimnis.
Klingt simpel? Ist es auch. Das Erstaunliche ist nur, dass dieser eine Trick — wieder und wieder Token für Token — am Ende plötzlich aussieht wie echtes Denken: Code schreiben, Aufgaben lösen, Witze machen, übersetzen. Niemand hat das so erwartet, als die Forscher das anfingen.
Bei ChatGPT: du tippst eine Frage → das Modell tokenisiert sie → für jedes neue Wort, das es generiert, rechnet es Millionen mal: „welches Token ist nach all dem hier am wahrscheinlichsten?" → wählt eines → hängt es an → wiederholt. Wort für Wort, bis ein „Stop"-Token kommt.
02Live-Demo: Tokens & nächste Vorhersage 🔡
LLMs sehen keine Buchstaben oder Wörter — sie sehen „Tokens". Tipp einen Satz, beobachte wie er zerlegt wird. Unten siehst du, was das Modell als nächstes Token vorschlagen würde:
platform.openai.com/tokenizer, um exakte Counts zu sehen.
03Attention: das Herz der Transformer 🎯
2017 erschien das Paper „Attention Is All You Need" — und alles, was du heute als „AI" kennst, baut darauf auf. Was ist Attention?
Idee in einem Satz: Für jedes Token im Input rechnet das Modell aus, wie stark es auf jedes andere Token „achten" soll, um den Kontext zu verstehen.
Beispiel: „Der Hund jagt die Katze, die schlief." Wenn das Modell „die" (das zweite) verarbeitet, muss es wissen, dass „die" auf „Katze" zurückzeigt, nicht auf „Hund". Attention erlaubt das — es richtet Aufmerksamkeit explizit auf das richtige frühere Token.
🔑 Self-Attention
Jedes Token schaut auf alle anderen Tokens im selben Text. So baut das Modell Beziehungen auf — Subjekt-Verb, Pronomen-Bezug, lange Distanzen.
📊 Multi-Head
Mehrere Attention-„Köpfe" parallel — jeder spezialisiert auf eine andere Art Beziehung (z.B. Syntax, Semantik, Position).
🪢 Self vs Cross
Self-Attention: Tokens vs sich selbst. Cross-Attention: zwischen Encoder + Decoder (z.B. Übersetzung Englisch → Deutsch).
📐 QKV-Math
Drei Matrizen — Query, Key, Value. Q × Kᵀ = Score. Softmax → Attention-Gewichte. Mit Value-Matrix multipliziert → Output.
04Wie ein LLM trainiert wird: 3 Stages
ChatGPT entsteht nicht in einem Schritt. Es sind drei sehr verschiedene Trainings-Phasen:
Pretraining
Modell liest das gesamte Internet (Bücher, Web, Code, etc.) und lernt nur eines: das nächste Token vorhersagen. Dauert Monate auf tausenden GPUs. Kosten: $50M–$500M.
Supervised Fine-Tuning
Menschen schreiben tausende Beispiel-Dialoge (gute Frage → gute Antwort). Modell lernt, in dieser Form zu antworten. Hier wird aus „Text-Vervollständiger" ein „Chatbot".
RLHF
„Reinforcement Learning from Human Feedback". Menschen bewerten Antworten (👍/👎). Das Modell lernt, was Menschen mögen — höflich sein, keine schädlichen Antworten geben, hilfreich sein.
05Prompt-Engineering: was wirklich funktioniert
Du kannst ein LLM nicht „programmieren" wie eine Funktion — aber du kannst gute Prompts schreiben, die ganz unterschiedlich gute Ergebnisse liefern.
❌ Schlecht: Vage
Schreib einen Aufsatz über AI
✅ Besser: Spezifisch + Rolle
Du bist Lehrer für Sek 1. Schreib einen 300-Wort- Aufsatz über AI, Tonalität freundlich, mit 3 Beispielen aus dem Alltag.
❌ Schlecht: Ohne Beispiele
Übersetze ins Schweizerdeutsch: "Wo ist der Bahnhof?"
✅ Besser: Few-Shot
Übersetze ins Züri-Dialekt: "Guten Tag" → "Grüezi mitenand" "Wie geht's?" → "Wie häsches?" "Auf Wiedersehen" → "Uf Widerluege" "Wo ist der Bahnhof?" → ?
❌ Schlecht: Keine Struktur
Mach mir einen Lernplan
✅ Besser: Format vorgeben
Erstelle einen 7-Tage-Lernplan für JavaScript-Anfänger. Output als Markdown-Tabelle mit Spalten: Tag, Topic, Übung, Dauer (Min).
🎯 Top-Trick: Chain-of-Thought
Aufgabe: Wenn Anna 3 Äpfel hat und Tim ihr 5 gibt, dann isst sie 2, wieviele bleiben? Denke Schritt für Schritt.
06Proprietary vs Open-Source LLMs
Zwei Welten — beide haben ihren Platz. Was wann nehmen?
| Modell | Anbieter | Typ | Stärke | Nutzung |
|---|---|---|---|---|
| GPT-5 | OpenAI | Closed | Allround, sehr stark | API + ChatGPT |
| Claude 4.6 | Anthropic | Closed | Code, lange Kontexte | API + Claude.ai |
| Gemini 2.5 | Closed | Multi-modal, Vision | API + Workspace | |
| Llama 4 | Meta | 🌍 Open-Weight | Selbst-hostbar, gratis | Ollama, vLLM, lokal |
| Mistral / Mixtral | Mistral AI 🇫🇷 | 🌍 Open-Weight | Klein + effizient | Edge-Devices, Embedded |
| DeepSeek V3 | DeepSeek 🇨🇳 | 🌍 Open-Weight | Open + Top-Performance | Lokal · CFL |
🎯Key Takeaways aus Page 05
- LLM = next-token predictor. Mehr ist es im Kern nicht. Nur viel davon.
- Tokens, nicht Wörter: ~3-4 Zeichen pro Token. API-Cost rechnet pro Token.
- Attention = Herz von Transformers. Jedes Token schaut auf jedes andere.
- 3 Trainings-Stages: Pretraining (Internet lesen) → SFT (Beispiel-Dialoge) → RLHF (Feedback).
- Prompt-Engineering: spezifisch, mit Rolle, Few-Shot-Examples, „denk Schritt für Schritt".
- Open-Source-LLMs wie Llama, Mistral kannst du lokal hosten. Top für Privacy + Cost.