15–20 J
📖 Page 04 von 8 · ~30 Min

Computer Vision: wie eine KI sieht 👁️

Für einen Computer ist ein Bild nichts als eine Tabelle aus Zahlen. Wie kommt da Verstehen rein? Auf dieser Page lernst du das wahre Geheimnis hinter Bilderkennung: Convolutional Neural Networks (CNNs). Plus: probiere live Filter aus, die zeigen, wie ein CNN „Kanten sieht".

📷 Pixel → Tensoren 🎮 Live Convolution Demo 🏷 YOLO · MobileNet · ViT
camera CNN 🐈 92% 🐕 5% 🐔 2% softmax

01Für einen Computer ist ein Bild nur eine Tabelle

Bevor wir über Modelle reden, müssen wir verstehen, was ein Bild im Computer überhaupt ist:

Ein digitales Bild ist nichts als eine Tabelle von Zahlen. Bei einem Schwarzweissbild: 0 = schwarz, 255 = weiss, Werte dazwischen = Grautöne.

Ein 8×8-Bild eines Smileys sieht für den Computer aus wie eine 8×8-Matrix mit Werten zwischen 0 und 255. Wo das Smiley schwarz ist → hohe Werte. Wo Hintergrund ist → tiefe Werte.

RGB-Bilder haben 3 solche Matrizen — eine pro Farbkanal (Rot, Grün, Blau). Ein 200×200-Foto ist also ein 200 × 200 × 3 = 120 000-Zahlen-Block. Ein 4K-Bild: 25 Millionen Zahlen.

8×8 Smiley als Pixel

[[0,0,1,1,1,1,0,0],
[0,1,0,0,0,0,1,0], ...]

🤓
Das ist ein „Tensor": In PyTorch heisst so ein Block einfach tensor — eine Multi-Dimensionale Matrix. Bilder = 3D-Tensoren (H × B × C). Video = 4D (Frames × H × B × C). Batch von Videos = 5D.

02Live-Demo: Convolution-Filter in Action 🎮

Hier ist die Kern-Operation jedes CNN. Eine kleine 3×3-Matrix („Kernel") gleitet über das Bild, multipliziert und summiert die Pixel — daraus entsteht ein neues Bild, das bestimmte Features hervorhebt. Klick einen Filter unten und vergleich Original mit Resultat:

Original

Nach Filter

Aktueller Kernel
-1
-1
-1
-1
8
-1
-1
-1
-1
🧠
Was hier in 1 Satz passiert: Der Kernel wird über das Bild „gefaltet" (convolved) — jeder Output-Pixel ist eine gewichtete Summe seiner Nachbarn. Bei der Kantenerkennung gewinnen Stellen mit grossem Helligkeits-Sprung. Bei „Blur" werden Nachbarn gemittelt → weichgespült.
🤯
Der CNN-Trick: Diese Kernel sind lernbare Parameter. Das Netz lernt selbst, welche Kernel hilfreich sind, um Katzen von Hunden zu unterscheiden. Frühe Layer lernen Kanten, mittlere Layer lernen Texturen/Augen/Nasen, späte Layer lernen ganze Tierkonzepte.

03Anatomie eines CNN

Ein typisches CNN ist eine Pipeline aus 4 Bausteinen. Bild rein → Klassen-Vorhersage raus:

📷

Input

224×224×3 Pixel

🔲

Conv-Layers

Filter scannen Bild

📉

Pooling

Bild kleiner machen

🎯

Dense + Softmax

Wahrscheinlichkeit pro Klasse

Was die einzelnen Layer tun:

  • Convolutional Layer: Wendet viele lernbare Kernel an. Output: „Feature Maps" — welche Stellen aktivieren auf Kante/Textur/Form?
  • Pooling Layer: Macht das Bild kleiner (z.B. Max-Pool nimmt das Maximum aus 2×2-Pixel-Blöcken). Spart Rechenzeit + macht das Netz invariant gegen kleine Verschiebungen.
  • Dense Layer: Klassisches Neural Network (wie Page 02). Nimmt alle Features und kombiniert sie zur Entscheidung.
  • Softmax: Wandelt die letzten 1000 Zahlen in Wahrscheinlichkeiten (0–1, summe = 1). „92% Katze, 5% Hund, …"
💡
Tiefes Netz baut Hierarchie: Layer 1 lernt einfache Kanten. Layer 5 lernt Augen, Schnauzen. Layer 10 lernt ganze Katzen. Layer 15 lernt „diese Katze sieht boese aus". Je tiefer, desto abstrakter.

04Die 6 CV-Tasks, die du im Alltag siehst

Nicht jedes Vision-Problem ist „was ist das?". Hier die wichtigsten Aufgaben + welche Modelle dafür:

🏷 Image Classification

„Was ist auf dem Bild?" Ein Label pro Bild. Klassiker: ist das ein Hund oder eine Katze?

ResNet · MobileNet · EfficientNet · ViT

📍 Object Detection

„Wo ist was?" Liefert Bounding-Boxes mit Klasse pro erkanntem Objekt. Mehrere Objekte pro Bild.

YOLOv8 · DETR · Faster R-CNN

🎨 Semantic Segmentation

„Welche Pixel gehören zu was?" Färbt jedes Pixel mit seiner Klasse. Z.B. für selbstfahrende Autos: Strasse, Auto, Fussgänger.

U-Net · DeepLab · Mask2Former

📊 Pose Estimation

„Wo sind Gelenke/Keypoints?" Skelett-Punkte für Menschen, Tiere, Hände. Basis für Yoga-Apps, Sport-Analyse.

MediaPipe · OpenPose · YOLOv8-pose

👁 Face Recognition

„Wer ist das?" Erkennt + identifiziert Gesichter. Smartphone-Entsperrung, Foto-Tagging.

FaceNet · ArcFace · DeepFace

🖼 Generative / Diffusion

„Generier mir ein Bild": Stable Diffusion, DALL·E, Midjourney. Anderer Modell-Typ als CNN, aber auch Vision.

Stable Diffusion · DALL·E · FLUX

05Code-Beispiel: vortrainiertes Modell in 5 Zeilen

Du musst nie selbst ein CNN from-scratch trainieren. Pretrained Modelle sind kostenlos verfügbar — du lädst eins runter und nutzt es:

PyTorch + Transformersfrom transformers import pipeline from PIL import Image # 1 Zeile: Modell laden (Download passiert beim ersten Mal) classifier = pipeline("image-classification", model="google/vit-base-patch16-224") # 2 Zeilen: Bild laden + klassifizieren img = Image.open("mein_foto.jpg") results = classifier(img) # 1 Zeile: Top-Klasse ausgeben print(results[0]) # {'label': 'tabby cat', 'score': 0.94}
🤗
Hugging Face Hub: Über 500'000 vortrainierte Modelle. Such „image-classification" oder „object-detection" → such ein Modell aus → Code copy-paste. Funktioniert für 99% aller Standard-Aufgaben ohne dass du auch nur 1 Stunde trainierst.

06CV auf dem ESP32 / RPi? Edge-AI!

Du musst nicht alles in der Cloud laufen lassen. Moderne kleine Modelle laufen direkt auf MCUs / SBCs:

PlattformModellSpeedUse-Case
ESP32-CAM TinyML / Edge Impulse ~5 FPS Bewegung, Person ja/nein
Raspberry Pi 4/5 YOLOv8n · MobileNet ~10–30 FPS Robot-Vision, Sicherheits-Cam
RPi 5 + AI HAT YOLOv8s · ResNet50 ~60–100 FPS Echtzeit-Detection, Edge-Inferenz
Jetson Nano / Orin Grosse Modelle 100+ FPS Selbstfahrende Mini-Roboter
🤖
Vorteil Edge: Privacy (keine Daten verlassen Gerät), niedrige Latenz, offline-fähig, kein Cloud-Cost. Vorteile Cloud: bessere Modelle möglich, Updates einfacher, weniger Hardware. Beste Wahl: oft beides — kleines Modell am Edge, grosses in der Cloud bei schweren Fällen.

🎯Key Takeaways aus Page 04