Synthetic Data (synthetische Trainingsdaten)

Synthetic Data sind künstlich erzeugte Datensätze, die reale Daten in Struktur und statistischen Eigenschaften nachbilden und dabei ohne die echten Originaldatensätze auskommen sollen. Ob ein synthetischer Datensatz im Einzelfall tatsächlich keinen Personenbezug mehr aufweist, ist gesondert zu prüfen. KI-Modelle generieren dabei Text-, Bild- oder Tabellendaten, die zum Training oder Testen anderer KI-Systeme dienen, vor allem dort, wo echte Daten knapp, teuer oder aus Datenschutzgründen schwer nutzbar sind.

In der Praxis

Synthetic Data helfen dort, wo reale Trainingsdaten fehlen oder rechtlich heikel sind, etwa bei medizinischen oder Finanzdaten, und werden zunehmend eingesetzt, weil hochwertige reale Trainingsdaten im offenen Web knapper werden. Ein bekanntes Risiko ist "Model Collapse": Wird ein Modell wiederholt überwiegend mit von KI erzeugten statt echten Daten trainiert, können sich Fehler und Verzerrungen verstärken statt auszugleichen. Seriöse Anbieter mischen synthetische mit kuratierten Realdaten und prüfen Ergebnisse laufend gegen echte Referenzdaten.

Quellen

← Zurück zum Glossar