Zum Inhalt springen
ma-ki.io

Alle Beiträge

Grundlagen · 2 von 10 Nr. 0002

Was ein Sprachmodell wirklich tut

Von Martin Kirschner · · 3 Minuten Lesezeit · Belege geprüft am

Es rät das nächste Textstück. Klingt banal, erklärt aber fast alles, was danach kommt: warum es so gut klingt, warum es Fehler macht und wo die Grenze liegt.

Als ich 2023 zum ersten Mal einen Prüfbericht in ein Sprachmodell gegeben habe, kam ein Text zurück, der besser formuliert war als meiner. Und mittendrin stand ein Aktenzeichen, das es nicht gibt. Wie kann etwas so gut schreiben und gleichzeitig so falsch liegen?

Die Antwort steckt darin, was so ein Modell überhaupt tut. Und das ist erstaunlich wenig.

Es rät das nächste Stück Text

Ein Sprachmodell hat aus riesigen Textmengen eine einzige Fähigkeit gelernt: vorherzusagen, welches Stück Text mit welcher Wahrscheinlichkeit als nächstes kommt. Mehr ist dieser Kern nicht. Schreibt man „Die Hauptstadt von Österreich ist", ist die Wahrscheinlichkeit für „Wien" sehr hoch, für „Salzburg" niedrig, für „Traktor" fast null. Aus diesen Wahrscheinlichkeiten wird eines ausgewählt, je nach Einstellung zufällig oder streng das wahrscheinlichste, angehängt, und die Rechnung beginnt von vorne. Genau diesen Ablauf kann man auf der Seite zur Textgenerierung Wort für Wort mitgehen, an einem kleinen Modell, das im Browser läuft.

Ein Satz entsteht also Stück für Stück, ohne dass am Anfang feststeht, wo er endet. In diesem Kern gibt es keinen Plan, keine Absicht, keine Überprüfung. Was heutige Systeme darüber hinaus können, nachschlagen, Werkzeuge aufrufen, einen Zwischenschritt prüfen, ist um diesen Kern herumgebaut.

Dass daraus brauchbare Texte entstehen, ist die eigentliche Überraschung. Wer genug Sprache gesehen hat, hat nebenbei auch gelernt, wie Argumente gebaut sind und wie ein Vertrag formuliert wird. Das steckt alles in der Statistik.

Warum das erklärt, was danach kommt

Fast jede Eigenheit, über die man später stolpert, folgt aus diesem einen Punkt:

Es klingt sicher. Sprache, die zögert, ist selten. Also gibt das Modell auch dann eine flüssige Antwort, wenn seine Wahrscheinlichkeiten dünn sind.

Es erfindet. Wenn kein Aktenzeichen mit passendem Muster im Trainingstext war, bildet es eines, das so aussieht wie ein echtes. Dazu gibt es einen eigenen Beitrag.

Es rechnet nicht. Rechnen ist keine Sprachstatistik. Ein reines Modell schätzt, wie ein Ergebnis aussehen könnte. Moderne Systeme rufen deshalb für Rechenaufgaben einen echten Rechner auf.

Es kennt nur, was es gesehen hat. Was nach dem Trainingsschluss passiert ist oder in Ihrem Aktenschrank liegt, ist nicht enthalten. Es sei denn, man gibt es mit. Genau das macht eine Wissensdatenbank.

Was unter der Haube steckt

Die Bauform hinter den heutigen Modellen heißt Transformer und stammt aus einer Arbeit von 2017. Ihr Kern ist ein Mechanismus, der beim Vorhersagen des nächsten Stücks entscheidet, welche Teile des bisherigen Textes wichtig sind. Deshalb kann ein Modell einen Bezug über mehrere Absätze halten und weiß bei „die Anlage" noch, welche gemeint war.

Trainiert wird mit sehr viel Text. Meta hat für Llama 3 nach eigenen Angaben über 15 Billionen Texteinheiten verwendet. Diese Größenordnung ist der Grund, warum es funktioniert, und zugleich, warum niemand genau sagen kann, was drinsteckt.

Was ich mir daraus mitgenommen habe

Seit ich weiß, dass da eine Wahrscheinlichkeitsrechnung arbeitet und kein Nachschlagewerk, erwarte ich keine Wahrheit, sondern einen guten Entwurf. Ich prüfe jede Zahl, jeden Namen, jede Fundstelle. Und ich baue Systeme so, dass die Prüfung eingebaut ist statt der Hoffnung.

Die Begriffe „denken" und „verstehen" benutze ich seither nicht mehr für Sprachmodelle. Nicht aus Prinzipienreiterei, sondern weil sie einen falschen Erwartungshorizont aufmachen. Und falsche Erwartungen sind bei KI-Vorhaben teurer als jede Lizenz.

Quellen: Vaswani u. a., „Attention Is All You Need", 20171 · Meta zu Llama 3, 20242

Quellen

  1. 1Vaswani u. a., „Attention Is All You Need", 2017 arxiv.org
  2. 2Meta zu Llama 3, 2024 ai.meta.com

Teilen

Lesereise · Grundlagen in fünf Schritten · 2 von 5

Nächster Schritt: Warum KI erfindet und es selbst nicht merkt

Dazu passt

Nächste Grundlage Tokens: warum die KI keine Wörter liest