Zum Inhalt springen
ma-ki.io

Alle Beiträge

Grundlagen · 9 von 10 Nr. 0009

Was ein Sprachmodell nicht kann

Von Martin Kirschner · · 4 Minuten Lesezeit · Belege geprüft am

Zwei Grenzen, die im Alltag mit einem Leistungsverzeichnis auftreten: Ein Sprachmodell allein rechnet nicht nachvollziehbar, und was es über Ihren Fall weiß, muss in der laufenden Eingabe stehen. Wer beides kennt, holt sich das richtige Werkzeug dazu.

Angenommen, Sie haben ein Leistungsverzeichnis mit dreißig Positionen im Chatfenster und lassen sich die Summe je Titel ausrechnen. Jede Zeile stimmt, nur die Summe unten ist um ein paar hundert Euro daneben. Zwei Stunden später, nach einer langen Besprechung im selben Verlauf, fragen Sie nach dem Einheitspreis aus Position 12. Das Modell nennt eine Zahl, die dort nie gestanden ist. Beides ist kein Ausrutscher, beides ist Bauart.

Rechnen ist für das Modell eine Textaufgabe

Ein Sprachmodell erzeugt Text, indem es Stück für Stück ein nächstes Zeichenstück wählt, ein Token. Dass dabei immer das wahrscheinlichste genommen wird, stimmt nicht: In der Schnittstelle von Anthropic steuern temperature, top_p und top_k, wie viel Zufall in die Auswahl kommt (Anthropic, Messages API1). Für Zahlen läuft es gleich wie für Wörter. Ein Rechenwerk hat das Modell nicht; was es an Rechnen kann, ist Muster aus dem Training, welche Zeichenfolge auf „Summe:" meistens folgt. Bei kleinen, häufigen Aufgaben trifft das Muster. Bei dreißig Zeilen mit krummen Beträgen wird die Kette der Zwischenschritte lang, und irgendwo darin rutscht ein Übertrag.

Dziri und Kollegen haben das an mehrstelligen Multiplikationen untersucht, an Logikrätseln und an einer Aufgabe aus der dynamischen Programmierung. Ihr Befund: Die Modelle lösen solche Aufgaben, indem sie bekannte Teilmuster aneinanderreihen, ohne dass sich dabei zwingend ein systematisches Verfahren ausbildet. Je mehr Schritte nötig sind, desto schneller bricht die Trefferquote ein (Dziri u. a. 2023, Faith and Fate2). Warum das Modell aus demselben Grund auch beim Zählen schwächelt, steht im Beitrag über Tokens.

Der Ausweg ist kein besseres Modell, sondern ein Werkzeug, das rechnet. Was Sie im Chatfenster bedienen, ist ohnehin selten das nackte Modell, sondern ein System, das solche Werkzeuge dazuschalten kann. Anthropic bietet in seiner Schnittstelle eine Codeausführung an: Das Modell schreibt ein kleines Programm, das rechnet, und das Ergebnis kommt in den Text (Anthropic, Code execution tool3). Ob das Werkzeug mitgelaufen ist, schaue ich in der Antwort nach; wird kein ausgeführter Code angezeigt, rechne ich selbst.

Der Denkmodus zerlegt, er ersetzt das Rechenwerkzeug nicht

Neuere Modelle haben einen Denkmodus: Vor der Antwort arbeiten sie die Aufgabe intern in Zwischenschritten durch. Zu sehen bekommen Sie davon wenig: Anthropic schreibt, der angezeigte Text sei nie die rohe Gedankenkette, sondern eine Zusammenfassung, bei den neuesten Modellen standardmäßig gar keine (Anthropic, Thinking4). Wei und Kollegen haben 2022 gezeigt, dass Modelle mit solchen Zwischenschritten bei Textaufgaben mit Rechenanteil deutlich besser abschneiden als ohne (Wei u. a. 2022, Chain-of-Thought Prompting5). Das Zerlegen hilft, weil eine Aufgabe in kleinen Schritten näher an den bekannten Mustern liegt. Der einzelne Schritt bleibt aber ein Textschritt. Das sind bessere Chancen, keine Gewissheit; für Positionssummen bleibe ich beim Rechenwerkzeug.

Was das Modell über Ihren Fall weiß, steht in der Eingabe

Die zweite Grenze ist das Gedächtnis. Allgemeines Wissen ist beim Training in die Gewichte gewandert. Über Ihr Projekt weiß es nichts außer dem, was gerade dasteht: den bisherigen Verlauf plus die neue Frage. Anthropic trennt beides ausdrücklich: Das Kontextfenster sei nicht die Trainingsdatenmenge, sondern das Arbeitsgedächtnis des Modells (Anthropic, Context windows6).

Daraus folgen zwei Dinge. Erstens: Ist der Verlauf lang, wird er nicht gleichmäßig gelesen. Liu und Kollegen haben die gesuchte Angabe in langen Eingaben an verschiedene Stellen gesetzt: Am Anfang und am Ende wurde sie zuverlässig gefunden, in der Mitte deutlich schlechter (Liu u. a. 2023, Lost in the Middle7). Position 12 von dreißig liegt weder am Anfang noch am Ende. Für das Beispiel vom Beginn dieses Beitrags kommt noch etwas dazu: Dieselbe Anthropic-Seite beschreibt, dass mit wachsender Länge Genauigkeit und Erinnerung sinken, dort context rot genannt, und dass Chat-Oberflächen wie claude.ai das Kontextfenster nach dem Prinzip first in, first out verwalten können. Ob eine Oberfläche das tut, entscheidet der Anbieter; eine Eigenschaft des Modells ist es nicht. Das Leistungsverzeichnis vom Gesprächsbeginn ist nach zwei Stunden also unscharf greifbar, je nach Oberfläche gar nicht mehr im Fenster.

Zum Ausprobieren: was im Fenster bleibt Ziehen Sie das Gespräch in die Länge und schauen Sie zu, was mit der wichtigen Angabe passiert.

ältere Nachrichtenneuere

Ein Klick in den Streifen legt die wichtige Angabe an eine andere Stelle.

Bei dreißig Nachrichten liegt das Leistungsverzeichnis an Stelle 12, also mitten drin. Dort wird es am schlechtesten gefunden.

Schematisch. Die Fenstergröße von 40 Nachrichten ist für dieses Schaubild gesetzt und sagt nichts über ein bestimmtes Modell. Dass Anfang und Ende zuverlässig gefunden werden und die Mitte nicht, stammt aus Liu u. a. 2023, das Verwalten nach first in, first out von Anthropic. Beide Belege stehen im Absatz darüber.

Zweitens: Was zu Ihrem Fall nicht in der Eingabe steht, kann in die Antwort nicht einfließen. Anthropic hat eine Gedächtnisfunktion nachgerüstet: einzelne Einträge, die während des Chats gelesen und aktualisiert werden (Anthropic, Chat search and memory8). Für das Modell ist das, soweit ich das beurteile, nichts anderes als Text in der Eingabe. Es selbst merkt sich nichts.

Darauf achte ich

  • Summen, Massen und Einheitspreise lasse ich rechnen, nicht schätzen. Ist kein Werkzeug gelaufen, gilt mir die Zahl als unbelegt.
  • Auf einen langen Verlauf verlasse ich mich nicht. Was wichtig ist, stelle ich neu an den Anfang.
  • Ein neues Thema bekommt ein neues Gespräch. Das Leistungsverzeichnis lade ich dort frisch hoch.
  • Was das Modell über meinen Fall wissen soll, muss ich ihm jedes Mal geben. Bei den knapp 2.000 Dokumenten der Wissensdatenbank läuft genau das im Hintergrund: Die passenden Absätze werden bei jeder Frage in die Eingabe geholt.

Quellen

  1. 1Anthropic, Messages API platform.claude.com
  2. 2Dziri u. a. 2023, Faith and Fate arxiv.org
  3. 3Anthropic, Code execution tool platform.claude.com
  4. 4Anthropic, Thinking platform.claude.com
  5. 5Wei u. a. 2022, Chain-of-Thought Prompting arxiv.org
  6. 6Anthropic, Context windows platform.claude.com
  7. 7Liu u. a. 2023, Lost in the Middle arxiv.org
  8. 8Anthropic, Chat search and memory support.claude.com

Teilen

Lesereise · Grundlagen in fünf Schritten · 4 von 5

Nächster Schritt: Was KI messbar bringt, und warum das Gefühl täuscht

Dazu passt

Nächste Grundlage Was KI messbar bringt, und warum das Gefühl täuscht