Zum Inhalt springen
ma-ki.io

Alle Beiträge

Grundlagen · 3 von 10 Nr. 0003

Tokens: warum die KI keine Wörter liest

Von Martin Kirschner · · 3 Minuten Lesezeit · Belege geprüft am

„Aktenzeichen 2024-AZ-00815-K" sind 28 Zeichen und 12 Tokens. Was das bedeutet, warum derselbe Inhalt auf Deutsch meist mehr Tokens braucht als auf Englisch und wieso die KI beim Buchstabenzählen scheitert.

Auf der Startseite läuft rechts eine kleine Anzeige, die einen Satz zerlegt. Das ist kein Effekt, sondern der Punkt, an dem viele Missverständnisse anfangen. Ein Sprachmodell sieht keine Wörter. Es sieht Tokens.

Was ein Token ist

Bevor Text in ein Modell geht, wird er zerlegt. Nicht in Wörter und nicht in Buchstaben, sondern in Stücke, die im Trainingstext häufig zusammen vorkamen. Häufige Wörter bleiben ganz, seltene zerfallen.

Ein Beispiel, mit dem Tokenizer von GPT-4o berechnet (tiktoken1):

TextZeichenTokens
Künstliche Intelligenz verändert unsere Arbeit.4710
Angebotsprüfung dauert heute zwei bis fünf Minuten.5111
Aktenzeichen 2024-AZ-00815-K2812

„Künstliche" wird zu K + ünst + liche. „Intelligenz" zu Int + elligen + z. Und das Aktenzeichen, das für einen Techniker eine einzige Information ist, zerfällt in zwölf Teile.

Jedes Token bekommt eine Nummer. Das Modell rechnet nicht mit Buchstaben, sondern mit diesen Nummern. Am Ende wird zurückübersetzt. Was zwischen dem Zerlegen und dem Zurückübersetzen passiert, zeigt die Seite zur Textgenerierung.

Drei Dinge, die daraus folgen

Deutsch ist teurer als Englisch. Abrechnung und Grenzen laufen über Tokens, verrechnet wird je Million Tokens (Anthropic, Preise2). Deutsche Komposita und Umlaute zerfallen stärker als englische Wörter. Derselbe Inhalt kostet auf Deutsch bei den gängigen Tokenizern meist mehr Tokens; wie stark, hängt vom Tokenizer ab (Petrov u. a., arXiv 2305.154253). Bei Fachtexten mit Sonderzeichen und Zahlen wird es besonders ungünstig, wie das Beispiel oben zeigt.

Das Kontextfenster ist in Tokens gemessen. Wie viel ein Modell auf einmal überblicken kann, wird in Tokens angegeben, nicht in Seiten (Anthropic, Kontextfenster4). Bei deutschem Fachtext rechne ich grob mit anderthalb bis zwei Tokens je Wort. Ein 30-seitiges Leistungsverzeichnis liegt damit schnell im fünfstelligen Bereich.

Buchstaben zählen kann es schlecht. Die berühmte Frage, wie viele „r" in „Erdbeere" stecken, ist auch deshalb schwer: Das Modell sieht das Wort nicht als Buchstabenkette, sondern als vier Blöcke, E + rd + be + ere. Es ist, als würde man jemanden bitten, die Buchstaben in einem Wort zu zählen, das er nur als Bild kennt.

Was das im Alltag heißt

Wenn ich abschätze, was ein Vorhaben kostet, rechne ich in Tokens, nicht in Dokumenten. Ein Ordner mit tausend Seiten Vertragstext ist etwas völlig anderes als tausend Seiten Fließtext.

Wenn eine Antwort mitten im Satz abbricht, ist meist das Ausgabelimit erreicht, nicht die Geduld des Modells. Die Schnittstelle nennt daneben weitere Stop-Gründe, etwa ein volles Kontextfenster (Anthropic, Stop-Gründe5).

Und wenn jemand eine Aufgabe stellt, bei der es auf einzelne Zeichen ankommt, etwa Prüfziffern oder Zeichenketten vergleichen, gebe ich das nicht dem Sprachmodell, sondern einem kleinen Programm. Das kostet fünf Zeilen Code und zählt richtig, weil es zählt statt zu schätzen.

Die Anzeige auf der Startseite rechnet mit echten Werten. Es gibt auch Tokenizer zum Ausprobieren im Netz, bei denen man eigenen Text einwerfen kann.

Wie ein Modell aus diesen Stücken Wort für Wort einen Satz baut, können Sie in der KI-Werkstatt selbst durchspielen. Dort rechnet ein kleines Modell im Browser, und Sie sehen zu jedem möglichen nächsten Wort die Zahl dahinter.

Quellen

  1. 1tiktoken github.com
  2. 2Anthropic, Preise platform.claude.com
  3. 3Petrov u. a., arXiv 2305.15425 arxiv.org
  4. 4Anthropic, Kontextfenster platform.claude.com
  5. 5Anthropic, Stop-Gründe platform.claude.com

Teilen

Dazu passt

Nächste Grundlage Wie ein Modell Bedeutung misst