Multimodale KI

Multimodale KI bezeichnet Systeme, die mehrere Eingabe- und Ausgabeformen gleichzeitig verarbeiten können – etwa Text, Bild, Audio und Video –, statt nur auf eine einzige Modalität wie reinen Text beschränkt zu sein.

In der Praxis

Multimodale KI-Suchsysteme können zunehmend auch Bildinhalte, Alt-Texte und Videotranskripte einer Website auswerten. Aussagekräftige Bildbeschreibungen und gut strukturierte Video-Untertitel werden dadurch zu einem zusätzlichen, oft unterschätzten Sichtbarkeitsfaktor.

Passende Leistung

← Zurück zum Glossar