14+ J
🕷️ Page 04 von 8 · ~25 Min

Anatomie einer Suchmaschine 🕷️

Google indexiert ~400 Milliarden Seiten. Wie geht das? In dieser Seite öffnen wir die Black-Box: Crawler (Spider, robots.txt, Crawl-Budget), Indexer-Pipeline (Parse → Tokenize → Index) und Ranker-Stages (von Milliarden auf 10 Treffer in 200ms).

🕷️ Crawler 📂 robots.txt ⚙️ Indexer-Pipeline 📊 PageRank
🕷️ Crawler folgt Links durch das ganze Web

01Recap: die drei Maschinen

In Page 01 haben wir's überflogen – jetzt gehen wir in jede tief rein.

🕷️

1. Crawler

Lädt Webseiten herunter, folgt Links. Heisst bei Google Googlebot, bei Bing Bingbot.

📚

2. Indexer

Verarbeitet die Seiten: Tokenization, Sprache erkennen, Inverted Index aufbauen, Metadaten speichern.

🎯

3. Ranker

Bei einer Suche: filtert & sortiert die relevantesten Seiten. Mehrstufig (kandidaten → fein-ranking).

02Der Crawler im Detail

Ein Programm, das 24/7 nichts anderes macht, als Webseiten herunterzuladen.

So denkt ein Crawler

  1. Starte mit einer Seed-Liste bekannter URLs (z.B. wikipedia.org).
  2. Lade die Seite via HTTP runter.
  3. Extrahiere alle Links aus dem HTML (<a href="...">).
  4. Füge die neuen Links in eine Queue – aber nur die, die du noch nicht hattest.
  5. Speichere den Inhalt zur späteren Verarbeitung (Cache / Snapshot).
  6. Zurück zu Schritt 2, mit der nächsten URL aus der Queue.

In groß: tausende Crawler-Prozesse laufen parallel, jeder Tag Milliarden Requests. Das Web wird in einer Art „atmender Wolke" ständig neu erfasst.

robots.txt – das Türschild

Jede Domain kann eine /robots.txt haben – eine Datei, die Crawlern sagt, was sie indexieren dürfen und was nicht. Beispiel:

ROBOTS.TXT # Allen Bots verbieten, /admin/ zu crawlen User-agent: * Disallow: /admin/ Disallow: /private/ # Googlebot darf alles ausser /betatest/ User-agent: Googlebot Disallow: /betatest/ # Wo unsere Sitemap liegt Sitemap: https://lunolabs.ch/sitemap.xml
⚠️
robots.txt ist eine Bitte, kein Gesetz. Anständige Crawler (Google, Bing) respektieren sie. Böse Bots ignorieren sie. Echte Sicherheit braucht Auth, nicht robots.txt.

sitemap.xml – die Inhaltsangabe

Eine Sitemap ist ein Verzeichnis aller deiner URLs für den Crawler. So sieht eine aus:

XML <urlset> <url> <loc>https://lunolabs.ch/</loc> <lastmod>2026-05-01</lastmod> <changefreq>weekly</changefreq> <priority>1.0</priority> </url> <url> <loc>https://lunolabs.ch/kurs_ai.html</loc> <lastmod>2026-05-08</lastmod> </url> </urlset>

Crawl-Budget

Google crawlt nicht alle deine Seiten gleich oft. Wie viel Aufmerksamkeit du bekommst, ist das Crawl-Budget. Es hängt ab von:

03Die Indexer-Pipeline

Aus rohem HTML wird ein durchsuchbarer Index – in mehreren Schritten.

1. Parsing – HTML zerlegen Strukturelemente identifizieren: Titel (<title>), Überschriften (<h1>), Body, Meta-Tags. Scripts/CSS rauswerfen.
2. Language Detection Welche Sprache? Das beeinflusst Tokenizer, Stemmer, Stopwords. Wichtig für mehrsprachige Sites.
3. Tokenization Text in Wörter zerlegen. Klingt einfach, ist es aber nicht (was tun mit „Lunolabs-Workshop"? „SO-101"? „3D-Drucker"?).
4. Normalization Lowercasing, Umlaute (ä → ae?), Akzente entfernen, Stopwords filtern, Stemming. → Details in Page 05.
5. Inverted-Index-Update Für jeden Token: füge Eintrag „Token → Dokument-ID, Position, Häufigkeit" in den Index ein.
6. Feature-Extraction für Ranking Auch Metadaten werden gespeichert: Dokument-Länge, Sprache, letzte Änderung, Anzahl Backlinks, PageRank, Spam-Score …
7. Speicherung im Suchcluster Der Index wird auf hunderte/tausende Server verteilt (Sharding). Sucht man später, fragt der Coordinator alle Shards parallel.
💡
Open-Source-Realität: Tools wie Apache Lucene, Elasticsearch und OpenSearch machen genau das. Wenn du eine Suche in deine App einbauen willst, läuft im Hintergrund eine vereinfachte Version dieser Pipeline.

04Der Ranker – wie aus Milliarden 10 Treffer werden

In 200ms aus 400 Milliarden Seiten die besten 10 herausfischen? Das geht nur in mehreren Stufen.

~400 Mrd alle Seiten im Index Recall ~10'000 enthält Suchwörter BM25 ~1'000 grob relevant ML-Rerank 10 deine Antwort 🎯 Multi-Stage Retrieval & Ranking

Die Stufen erklärt

  1. Retrieval (BM25 / Sparse): Aus dem Inverted Index alle Seiten holen, die die Suchwörter enthalten. Schnell, mit BM25 grob sortiert.
  2. Erste Filterung: Top ~1'000 nach Score. Hier fliegen die offensichtlich irrelevanten raus.
  3. Dense Re-Ranking: Ein Neural Model (Embeddings, BERT-ähnlich) bewertet die Top 1'000 fein. Das ist viel langsamer pro Doc, aber bei 1'000 statt 400 Mrd machbar.
  4. Final Ranking: Weitere Signale fliessen ein – Klick-Historie, Frische, Geo, Personalisierung, Spam-Filter. Top 10 ans UI.
Warum das Tempo möglich ist: Die billige Methode (BM25 im Index) wird auf alle Seiten angewendet. Die teure Methode (Neural Model) nur auf die Top 1'000. So bekommst du das Beste aus beiden Welten.

05PageRank – wie Links zählen

Der Algorithmus, der Google in den späten 90ern überhaupt erst gross gemacht hat.

Vor Google bewerteten Suchmaschinen Seiten nur nach Wort-Häufigkeit. Larry Page und Sergey Brin hatten eine bessere Idee: Eine Seite ist wichtig, wenn andere wichtige Seiten auf sie verlinken. Das ist PageRank.

Die Intuition

Stell dir vor, du surfst zufällig im Web: du bist auf einer Seite, klickst auf einen zufälligen Link, landest auf der nächsten Seite, klickst wieder. Wenn du sehr lange so surfst – auf welchen Seiten verbringst du am meisten Zeit? Diese Seiten haben hohen PageRank.

PR(A) = (1-d) + d × Σ ( PR(Ti) / C(Ti) )
PR(A) = PageRank von A · T_i = Seiten die auf A verlinken · C(T_i) = Anzahl ausgehender Links von T_i · d = Damping (~0.85)

Mit anderen Worten: Eine Seite kriegt PageRank, wenn andere auf sie verlinken. Aber: ein Link von einer hochrangigen Seite (mit wenigen anderen Links) zählt viel mehr als ein Link von einer Spam-Farm mit 1'000 ausgehenden Links.

📰
Heute: PageRank ist nur noch eines von hunderten Signalen bei Google. Aber das Konzept (Autorität durch Verlinkungs-Struktur) ist immer noch fundamental – und in Wissens-Graphen aller Art im Einsatz.

06Welche Signale fliessen ins Ranking?

Eine (sehr) unvollständige Liste der ~200 Signale, die Google angeblich benutzt:

📝 On-Page Signale

Suchwort im Titel? In H1? Wie oft? Dokumentlänge? Keyword in URL? Bilder mit Alt-Tags? Strukturierte Daten (Schema.org)?

🌐 Off-Page Signale

Wie viele Seiten verlinken hierauf? Wie autoritär sind die? Wie alt ist die Domain? Wie viele direkte Besucher?

⚡ Technische Signale

Wie schnell lädt die Seite? Mobile-friendly? HTTPS? Core Web Vitals (LCP, CLS, FID)?

🧑 User-Signale

Klicken Leute drauf? Bleiben sie lange? Oder springen sie sofort zurück zur Suche („Pogo-Sticking" = schlechtes Zeichen)?

🎯Key Takeaways