Technik verstehen.
Ideen weiterdenken.
Beginne mit einer Frage. Hinter den Abkürzungen stecken Bausteine, die du in ganz unterschiedlichen Projekten verwenden kannst.
Vom Bild zum eigenen Modell.
Ein Lernweg in drei Teilen: Verfolge ein Foto durch ein VLM, berechne echte Lernschritte und bereite ein Training mit eigenen Bildern vor.
Sehen & Bilder
- VLM Bild + Frage → Textantwort
Bilder verstehen
Was passiert zwischen Foto und Antwort? Verfolge Pixel, Bildmerkmale und Sprache durch ein VLM – und finde heraus, was es dabei wirklich lernt.
15 Min. Einstieg - Training Beispiele + Zielantworten → Angepasste Gewichte
So lernt ein Modell
Verändere echte Gewichte im Browser. Verfolge Vorhersage, Loss und Gradienten – und teste, ob das Gelernte auch bei neuen Bildern funktioniert.
20 Min. Einstieg - OCR Bild mit Schrift → Bearbeitbarer Text
Text aus Bildern lesen
Ein Foto wird zu Text, den du kopieren, durchsuchen oder vorlesen lassen kannst.
4 Min. Einstieg - Fine-Tuning Vortrainiertes VLM + eigene Beispiele → Adapter + Vergleich auf neuen Bildern
Ein VLM mit eigenen Bildern anpassen
Eine konkrete Aufgabe, saubere Bilddaten und ein messbarer Vergleich: Bereite deinen ersten LoRA-Versuch vor – mit einem herunterladbaren Python-Lernpaket.
25 Min. Einstieg
Sprache & Audio
- TTS Geschriebener Text → Gesprochene Sprache
Text vorlesen lassen
Aus geschriebenen Wörtern wird hörbare Sprache. Probiere aus, wie Tempo und Satzzeichen das Zuhören verändern.
4 Min. Einstieg - STT Gesprochene Sprache → Transkript
Gesprochenes aufschreiben
Aus einer Sprachaufnahme wird ein Transkript. Verstehe den Unterschied zwischen Gesagtem, erkanntem Text und einer ausgeführten Aufgabe.
4 Min. Einstieg
Du suchst etwas Bestimmtes?
Die gemeinsame Suche findet Erklärungen, Projekte, Beiträge und Kurse – auch über Begriffe wie „Sprachausgabe“ oder „Raspberry Pi“.