Computer Vision: wie eine KI sieht 👁️
Für einen Computer ist ein Bild nichts als eine Tabelle aus Zahlen. Wie kommt da Verstehen rein? Auf dieser Page lernst du das wahre Geheimnis hinter Bilderkennung: Convolutional Neural Networks (CNNs). Plus: probiere live Filter aus, die zeigen, wie ein CNN „Kanten sieht".
01Für einen Computer ist ein Bild nur eine Tabelle
Bevor wir über Modelle reden, müssen wir verstehen, was ein Bild im Computer überhaupt ist:
Ein digitales Bild ist nichts als eine Tabelle von Zahlen. Bei einem Schwarzweissbild: 0 = schwarz, 255 = weiss, Werte dazwischen = Grautöne.
Ein 8×8-Bild eines Smileys sieht für den Computer aus wie eine 8×8-Matrix mit Werten zwischen 0 und 255. Wo das Smiley schwarz ist → hohe Werte. Wo Hintergrund ist → tiefe Werte.
RGB-Bilder haben 3 solche Matrizen — eine pro Farbkanal (Rot, Grün, Blau). Ein 200×200-Foto ist also ein 200 × 200 × 3 = 120 000-Zahlen-Block. Ein 4K-Bild: 25 Millionen Zahlen.
8×8 Smiley als Pixel
[[0,0,1,1,1,1,0,0],
[0,1,0,0,0,0,1,0], ...]
tensor — eine Multi-Dimensionale Matrix. Bilder = 3D-Tensoren (H × B × C). Video = 4D (Frames × H × B × C). Batch von Videos = 5D.
02Live-Demo: Convolution-Filter in Action 🎮
Hier ist die Kern-Operation jedes CNN. Eine kleine 3×3-Matrix („Kernel") gleitet über das Bild, multipliziert und summiert die Pixel — daraus entsteht ein neues Bild, das bestimmte Features hervorhebt. Klick einen Filter unten und vergleich Original mit Resultat:
Original
Nach Filter
03Anatomie eines CNN
Ein typisches CNN ist eine Pipeline aus 4 Bausteinen. Bild rein → Klassen-Vorhersage raus:
Input
224×224×3 Pixel
Conv-Layers
Filter scannen Bild
Pooling
Bild kleiner machen
Dense + Softmax
Wahrscheinlichkeit pro Klasse
Was die einzelnen Layer tun:
- Convolutional Layer: Wendet viele lernbare Kernel an. Output: „Feature Maps" — welche Stellen aktivieren auf Kante/Textur/Form?
- Pooling Layer: Macht das Bild kleiner (z.B. Max-Pool nimmt das Maximum aus 2×2-Pixel-Blöcken). Spart Rechenzeit + macht das Netz invariant gegen kleine Verschiebungen.
- Dense Layer: Klassisches Neural Network (wie Page 02). Nimmt alle Features und kombiniert sie zur Entscheidung.
- Softmax: Wandelt die letzten 1000 Zahlen in Wahrscheinlichkeiten (0–1, summe = 1). „92% Katze, 5% Hund, …"
04Die 6 CV-Tasks, die du im Alltag siehst
Nicht jedes Vision-Problem ist „was ist das?". Hier die wichtigsten Aufgaben + welche Modelle dafür:
🏷 Image Classification
„Was ist auf dem Bild?" Ein Label pro Bild. Klassiker: ist das ein Hund oder eine Katze?
📍 Object Detection
„Wo ist was?" Liefert Bounding-Boxes mit Klasse pro erkanntem Objekt. Mehrere Objekte pro Bild.
🎨 Semantic Segmentation
„Welche Pixel gehören zu was?" Färbt jedes Pixel mit seiner Klasse. Z.B. für selbstfahrende Autos: Strasse, Auto, Fussgänger.
📊 Pose Estimation
„Wo sind Gelenke/Keypoints?" Skelett-Punkte für Menschen, Tiere, Hände. Basis für Yoga-Apps, Sport-Analyse.
👁 Face Recognition
„Wer ist das?" Erkennt + identifiziert Gesichter. Smartphone-Entsperrung, Foto-Tagging.
🖼 Generative / Diffusion
„Generier mir ein Bild": Stable Diffusion, DALL·E, Midjourney. Anderer Modell-Typ als CNN, aber auch Vision.
05Code-Beispiel: vortrainiertes Modell in 5 Zeilen
Du musst nie selbst ein CNN from-scratch trainieren. Pretrained Modelle sind kostenlos verfügbar — du lädst eins runter und nutzt es:
06CV auf dem ESP32 / RPi? Edge-AI!
Du musst nicht alles in der Cloud laufen lassen. Moderne kleine Modelle laufen direkt auf MCUs / SBCs:
| Plattform | Modell | Speed | Use-Case |
|---|---|---|---|
| ESP32-CAM | TinyML / Edge Impulse | ~5 FPS | Bewegung, Person ja/nein |
| Raspberry Pi 4/5 | YOLOv8n · MobileNet | ~10–30 FPS | Robot-Vision, Sicherheits-Cam |
| RPi 5 + AI HAT | YOLOv8s · ResNet50 | ~60–100 FPS | Echtzeit-Detection, Edge-Inferenz |
| Jetson Nano / Orin | Grosse Modelle | 100+ FPS | Selbstfahrende Mini-Roboter |
🎯Key Takeaways aus Page 04
- Bild = Tabelle aus Zahlen. RGB = 3 Kanäle, also 3D-Tensor (H × B × 3).
- Convolution = Kernel gleitet über Bild, multipliziert + summiert. Findet Features.
- CNN Pipeline: Conv → Pool → Conv → Pool → Dense → Softmax.
- Hierarchie: Frühe Layer = Kanten, späte Layer = Konzepte (Katze, Auto).
- 6 CV-Tasks: Classification, Detection, Segmentation, Pose, Face, Generative.
- Pretrained Modelle nutzen! Hugging Face Hub hat 500k+ ready-to-use Modelle.