Der Fall ist inzwischen berühmt: 2023 reichten zwei New Yorker Anwälte einen Schriftsatz mit sechs zitierten Gerichtsentscheidungen ein. Aktenzeichen, Zitate, alles vorhanden. Nur existierten die Urteile nicht. ChatGPT hatte sie erfunden. Das Gericht verhängte gegen die beiden Anwälte und ihre Kanzlei 5.000 Dollar Strafe.
Das Interessanteste daran ist nicht der Fehler, sondern was davor passierte: Die Anwälte hatten nachgefragt, ob die Urteile echt seien. Die KI hatte bejaht.
Es ist kein Fehler, es ist die Funktionsweise
Wer weiß, dass ein Sprachmodell das nächste Stück Text errät, sieht sofort, warum das passiert. Ein Aktenzeichen hat eine Form, ein Urteilstitel auch. Wenn im Trainingstext tausende davon vorkamen, kann das Modell diese Form nachbilden, auch ohne dass es dieses eine Urteil je gesehen hat. Es erzeugt etwas, das aussieht wie ein Urteil.
Dazu kommt: Das Modell selbst hat keinen Zugriff auf die Frage, ob etwas wahr ist, sondern nur Wahrscheinlichkeiten über Sprache. Eine angeschlossene Suche liefert Dokumente, keine Wahrheitsprüfung. „Ist das echt?" ist für das Modell wieder nur eine Frage, auf die es eine sprachlich passende Antwort erzeugt. Eine Prüfung steckt darin nicht, und deshalb taugt die Antwort auch nicht als Bestätigung.
Warum es nicht einfach „weiß ich nicht" sagt
Das ist der Punkt, den ich am spannendsten finde, und er kommt von OpenAI selbst. In einer Arbeit von 2025 beschreiben sie, dass die üblichen Bewertungsverfahren das Raten belohnen. Modelle werden an Testfragen gemessen, bei denen eine richtige Antwort Punkte gibt und eine falsche null. Ein „weiß ich nicht" gibt ebenfalls null.
Damit ist Raten die bessere Strategie. Ein Modell, das bei Unsicherheit schweigt, schneidet in den Ranglisten schlechter ab als eines, das selbstbewusst rät. Also wird auf Raten hin optimiert. Das ist kein Kinderfehler, der sich mit der nächsten Version erledigt, sondern eine Folge davon, wie gemessen wird.
Zählt eine falsche Antwort null, liegt Modell A drei Punkte vorn. In einer Rangliste steht es damit oben, obwohl es öfter falsch liegt.
Keine Messung, eine Rechnung: zwanzig Fragen, die sicheren sitzen bei beiden, die unsicheren rät A und lässt B aus. Punkte A = sichere + unsichere × Trefferquote (bei Abzug minus die verfehlten), Punkte B = sichere. Der Befund selbst, dass die üblichen Bewertungsverfahren das Raten belohnen, ist belegt im Absatz darüber.
Was wirklich hilft
Ich verlange Belege, statt der Antwort zu glauben. Deshalb ist die Fundstelle für mich die wichtigste Eigenschaft eines KI-Systems. Wenn zu jeder Aussage steht, aus welchem Dokument und von welcher Seite sie stammt, fällt eine Erfindung beim ersten Nachschlagen auf. Ohne Beleg fällt sie erst auf, wenn es teuer wird.
Ich schränke die Frage auf bekannte Unterlagen ein. Ein System, das nur aus Ihren Dokumenten antwortet, kann sich weniger ausdenken als eines, das frei aus dem Sprachwissen schöpft. Es kann trotzdem den falschen Absatz erwischen, aber der falsche Absatz existiert wenigstens.
Bei Zahlen, Namen und Aktenzeichen sehe ich nach. Das sind die Stellen, an denen Erfindungen sitzen. Fließtext ist meist harmlos, ein Aktenzeichen nicht.
Ich frage gezielt nach Nichtwissen. Bei einem neuen Werkzeug stelle ich absichtlich eine Frage, deren Antwort es nicht kennen kann. Was dann kommt, sagt mehr über das System als jede Werbeaussage.
Die wichtigste Konsequenz: Ich lasse KI keine Auskunft geben, die jemand ungeprüft weiterverwendet. Entwurf ja, Beleg ja, Entscheidung nein.
Quellen: Mata v. Avianca, US-Bezirksgericht New York, 20231 · OpenAI, „Why language models hallucinate", 20252
Wie ein System stattdessen aussieht, das seine Unsicherheit meldet statt sie zu verschweigen, zeigt die Station Rechnung auslesen in der KI-Werkstatt. Dort steht bei einem schlecht gedruckten Feld die Erkennungssicherheit dabei, und die Entscheidung trifft ein Mensch.
Quellen
- 1Mata v. Avianca, US-Bezirksgericht New York, 2023 courtlistener.com
- 2OpenAI, „Why language models hallucinate", 2025 openai.com