Anatomie einer Suchmaschine 🕷️
Google indexiert ~400 Milliarden Seiten. Wie geht das? In dieser Seite öffnen wir die Black-Box: Crawler (Spider, robots.txt, Crawl-Budget), Indexer-Pipeline (Parse → Tokenize → Index) und Ranker-Stages (von Milliarden auf 10 Treffer in 200ms).
01Recap: die drei Maschinen
In Page 01 haben wir's überflogen – jetzt gehen wir in jede tief rein.
1. Crawler
Lädt Webseiten herunter, folgt Links. Heisst bei Google Googlebot, bei Bing Bingbot.
2. Indexer
Verarbeitet die Seiten: Tokenization, Sprache erkennen, Inverted Index aufbauen, Metadaten speichern.
3. Ranker
Bei einer Suche: filtert & sortiert die relevantesten Seiten. Mehrstufig (kandidaten → fein-ranking).
02Der Crawler im Detail
Ein Programm, das 24/7 nichts anderes macht, als Webseiten herunterzuladen.
So denkt ein Crawler
- Starte mit einer Seed-Liste bekannter URLs (z.B. wikipedia.org).
- Lade die Seite via HTTP runter.
- Extrahiere alle Links aus dem HTML (
<a href="...">). - Füge die neuen Links in eine Queue – aber nur die, die du noch nicht hattest.
- Speichere den Inhalt zur späteren Verarbeitung (Cache / Snapshot).
- Zurück zu Schritt 2, mit der nächsten URL aus der Queue.
In groß: tausende Crawler-Prozesse laufen parallel, jeder Tag Milliarden Requests. Das Web wird in einer Art „atmender Wolke" ständig neu erfasst.
robots.txt – das Türschild
Jede Domain kann eine /robots.txt haben – eine Datei, die Crawlern sagt, was sie indexieren dürfen und was nicht. Beispiel:
sitemap.xml – die Inhaltsangabe
Eine Sitemap ist ein Verzeichnis aller deiner URLs für den Crawler. So sieht eine aus:
Crawl-Budget
Google crawlt nicht alle deine Seiten gleich oft. Wie viel Aufmerksamkeit du bekommst, ist das Crawl-Budget. Es hängt ab von:
- Server-Geschwindigkeit – langsame Server bekommen weniger Besuche
- Wie oft sich deine Seite ändert (News-Site = öfter, statische Seite = seltener)
- Wie wichtig deine Seite ist (Backlinks, Traffic, Autorität)
- Fehlerquote – viele 404? Crawler kommt weniger
03Die Indexer-Pipeline
Aus rohem HTML wird ein durchsuchbarer Index – in mehreren Schritten.
<title>), Überschriften (<h1>), Body, Meta-Tags. Scripts/CSS rauswerfen.
04Der Ranker – wie aus Milliarden 10 Treffer werden
In 200ms aus 400 Milliarden Seiten die besten 10 herausfischen? Das geht nur in mehreren Stufen.
Die Stufen erklärt
- Retrieval (BM25 / Sparse): Aus dem Inverted Index alle Seiten holen, die die Suchwörter enthalten. Schnell, mit BM25 grob sortiert.
- Erste Filterung: Top ~1'000 nach Score. Hier fliegen die offensichtlich irrelevanten raus.
- Dense Re-Ranking: Ein Neural Model (Embeddings, BERT-ähnlich) bewertet die Top 1'000 fein. Das ist viel langsamer pro Doc, aber bei 1'000 statt 400 Mrd machbar.
- Final Ranking: Weitere Signale fliessen ein – Klick-Historie, Frische, Geo, Personalisierung, Spam-Filter. Top 10 ans UI.
05PageRank – wie Links zählen
Der Algorithmus, der Google in den späten 90ern überhaupt erst gross gemacht hat.
Vor Google bewerteten Suchmaschinen Seiten nur nach Wort-Häufigkeit. Larry Page und Sergey Brin hatten eine bessere Idee: Eine Seite ist wichtig, wenn andere wichtige Seiten auf sie verlinken. Das ist PageRank.
Die Intuition
Stell dir vor, du surfst zufällig im Web: du bist auf einer Seite, klickst auf einen zufälligen Link, landest auf der nächsten Seite, klickst wieder. Wenn du sehr lange so surfst – auf welchen Seiten verbringst du am meisten Zeit? Diese Seiten haben hohen PageRank.
Mit anderen Worten: Eine Seite kriegt PageRank, wenn andere auf sie verlinken. Aber: ein Link von einer hochrangigen Seite (mit wenigen anderen Links) zählt viel mehr als ein Link von einer Spam-Farm mit 1'000 ausgehenden Links.
06Welche Signale fliessen ins Ranking?
Eine (sehr) unvollständige Liste der ~200 Signale, die Google angeblich benutzt:
📝 On-Page Signale
Suchwort im Titel? In H1? Wie oft? Dokumentlänge? Keyword in URL? Bilder mit Alt-Tags? Strukturierte Daten (Schema.org)?
🌐 Off-Page Signale
Wie viele Seiten verlinken hierauf? Wie autoritär sind die? Wie alt ist die Domain? Wie viele direkte Besucher?
⚡ Technische Signale
Wie schnell lädt die Seite? Mobile-friendly? HTTPS? Core Web Vitals (LCP, CLS, FID)?
🧑 User-Signale
Klicken Leute drauf? Bleiben sie lange? Oder springen sie sofort zurück zur Suche („Pogo-Sticking" = schlechtes Zeichen)?
🎯Key Takeaways
- Eine Suchmaschine = Crawler + Indexer + Ranker. Drei sehr verschiedene Maschinen.
- Crawler folgen Links rekursiv.
robots.txtundsitemap.xmlregeln, was & wie indexiert wird. - Crawl-Budget bestimmt, wie viel Aufmerksamkeit deine Seite kriegt.
- Die Indexer-Pipeline macht aus HTML: Parsing → Tokenize → Normalize → Index.
- Multi-Stage Ranking: BM25 für Vorauswahl, dann Neural Model fürs Feintuning.
- PageRank war die Killer-Idee: Autorität durch Verlinkung. Heute eines von vielen Signalen.
- Modernes Ranking nutzt ~200 Signale – On-Page, Off-Page, Technik, User-Verhalten.