Zum Inhalt springen
Kontakt

Vom Bild zur Stimme: drei Aufgaben, ein Projekt

OCR, visuelle Sprachmodelle und TTS helfen bei unterschiedlichen Aufgaben. So findest du den passenden Einstieg.

· LunoLabs Team

Welche Frage möchtest du beantworten?

«Was steht auf dem Schild?» führt zur Texterkennung. «Was ist auf dem Bild zu sehen?» führt zu visuellen Sprachmodellen. «Kannst du mir das vorlesen?» führt zur Sprachausgabe.

Die Bezeichnungen beschreiben Aufgaben. Bei der Auswahl eines konkreten Werkzeugs zählt deshalb zuerst, welches Ergebnis dein Projekt braucht.

Eine Verbindung zum Selberdenken

Unsere Projektidee für einen Vorlesehelfer verbindet Texterkennung mit Sprachausgabe. Ein sinnvoller Zwischenstopp ist die Prüfung des Textes: Ein Lesefehler sollte nicht unbemerkt zur gesprochenen Information werden.

Was du hier ausprobieren kannst

Die verknüpften Wissensseiten bieten einen kurzen Einstieg und erklärende Beispiele. Diese Einordnung basiert auf der verlinkten Dokumentation; sie ist kein eigener Modellvergleich. Einen konkreten Test würden wir mit Aufbau, Eingaben und beobachteten Ergebnissen gesondert veröffentlichen.

Quellen

Einordnung anhand der verlinkten Quellen; kein eigener Praxistest.

Die Grundlagen dazu.

  • VLM

    Bilder verstehen

    Was passiert zwischen Foto und Antwort? Verfolge Pixel, Bildmerkmale und Sprache durch ein VLM – und finde heraus, was es dabei wirklich lernt.

    Bild + Frage → Textantwort
    15 Min. Einstieg
  • OCR

    Text aus Bildern lesen

    Ein Foto wird zu Text, den du kopieren, durchsuchen oder vorlesen lassen kannst.

    Bild mit Schrift → Bearbeitbarer Text
    4 Min. Einstieg
  • TTS

    Text vorlesen lassen

    Aus geschriebenen Wörtern wird hörbare Sprache. Probiere aus, wie Tempo und Satzzeichen das Zuhören verändern.

    Geschriebener Text → Gesprochene Sprache
    4 Min. Einstieg

Was daraus entstehen kann.