Transformer-Architektur

Die Transformer-Architektur ist das 2017 von Google-Forschern vorgestellte neuronale Netzwerkmodell, auf dem praktisch alle modernen großen Sprachmodelle basieren. Ihre zentrale Neuerung war, ganz auf sequenzielle Verarbeitung zu verzichten und stattdessen allein über Selbstaufmerksamkeit (Self-Attention) zu bestimmen, wie stark jedes Wort im Text auf jedes andere bezogen wird; der Attention-Mechanismus selbst ist älter als die Transformer-Architektur.

In der Praxis

Für Unternehmen ist die Transformer-Architektur selbst kein Werkzeug zum direkten Einsatz, sondern technisches Hintergrundwissen. Sie erklärt, warum moderne Sprachmodelle deutlich längere Textzusammenhänge korrekt erfassen können als ältere KI-Textsysteme und warum sie beispielsweise in langen Dokumenten Bezüge über viele Sätze hinweg herstellen können.

Passende Leistung

Quellen

← Zurück zum Glossar