Multimodale KI
Multimodale KI bezeichnet Systeme, die mehrere Eingabe- und Ausgabeformen gleichzeitig verarbeiten können – etwa Text, Bild, Audio und Video –, statt nur auf eine einzige Modalität wie reinen Text beschränkt zu sein.
In der Praxis
Multimodale KI-Suchsysteme können zunehmend auch Bildinhalte, Alt-Texte und Videotranskripte einer Website auswerten. Aussagekräftige Bildbeschreibungen und gut strukturierte Video-Untertitel werden dadurch zu einem zusätzlichen, oft unterschätzten Sichtbarkeitsfaktor.