AngelStone
KI & Daten

Multimodale Modelle

Auch bekannt als: Multimodalität · Multimodal

KI-Systeme, die mehrere Informationsarten in einem Modell verarbeiten und verknüpfen: Text, Bild, Audio und teils Video.

Multimodale Modelle sind KI-Systeme, die mehrere Informationsarten in einem einzigen Modell verarbeiten und verknüpfen: Text, Bild, Audio und teils Video. Modalität steht dabei für die Form der Information; ein rein textbasiertes Sprachmodell kennt nur eine davon.

Ein multimodales Modell beschreibt ein Foto, liest eine abfotografierte Rechnung aus, beantwortet eine gesprochene Frage mit gesprochener Antwort oder fasst ein Video zusammen. Auch die Ausgabe kann mehrere Formen annehmen, etwa Text und Bild aus demselben System. Die aktuellen Spitzenmodelle der großen Anbieter, etwa GPT, Gemini oder Claude, arbeiten multimodal; die Trennung in reine Text- und reine Bildmodelle löst sich damit zunehmend auf.

Praktisch senkt das die Hürden: Statt Inhalte erst in Text zu übersetzen, verarbeitet die KI Screenshots, Skizzen, Pläne oder Sprachnachrichten direkt, vom Belegauslesen in der Buchhaltung bis zur automatischen Bildbeschreibung für barrierefreie Websites.

Aus der Praxis

Begriffe sind das eine. Umsetzung das andere.

Wir übersetzen Technologie in Lösungen, die zu deinem Geschäft passen — aus Wien für den DACH-Raum.

Projekt besprechen