Multimodale Modelle sind KI-Systeme, die mehrere Informationsarten in einem einzigen Modell verarbeiten und verknüpfen: Text, Bild, Audio und teils Video. Modalität steht dabei für die Form der Information; ein rein textbasiertes Sprachmodell kennt nur eine davon.
Ein multimodales Modell beschreibt ein Foto, liest eine abfotografierte Rechnung aus, beantwortet eine gesprochene Frage mit gesprochener Antwort oder fasst ein Video zusammen. Auch die Ausgabe kann mehrere Formen annehmen, etwa Text und Bild aus demselben System. Die aktuellen Spitzenmodelle der großen Anbieter, etwa GPT, Gemini oder Claude, arbeiten multimodal; die Trennung in reine Text- und reine Bildmodelle löst sich damit zunehmend auf.
Praktisch senkt das die Hürden: Statt Inhalte erst in Text zu übersetzen, verarbeitet die KI Screenshots, Skizzen, Pläne oder Sprachnachrichten direkt, vom Belegauslesen in der Buchhaltung bis zur automatischen Bildbeschreibung für barrierefreie Websites.