Erfindet die Maschine eine Klausel?
Das ist der Einwand, der vor jedem Vertrag steht, den jemand von einer Maschine prüfen lassen will. Er ist berechtigt. Eine Halluzination ist eine Ausgabe, die sprachlich einwandfrei und inhaltlich erfunden ist — ein Aktenzeichen, das es nicht gibt, ein Paragraf, der anders lautet, eine Klausel, die im Vertrag nicht steht. Sie fällt nicht auf, weil sie genau wie das Echte klingt.
Der Grund liegt in der Bauart. Ein Sprachmodell berechnet Wahrscheinlichkeiten über Zeichenfolgen; es fragt keine Datenbank ab und hat keinen Begriff davon, ob etwas existiert. Wo eine Information fehlt, entsteht an ihrer Stelle etwas, das aussieht wie die Information. Je spezifischer die Frage, desto plausibler die Erfindung — und juristische Fragen sind maximal spezifisch.
Wie oft — und warum eine Zahl nichts sagt
Nach der Häufigkeit wird am zweithäufigsten gefragt, und die Antwort ist unbequem: Zwischen den Messungen liegen zwei Größenordnungen, weil sie verschiedene Aufgaben messen.
Daraus folgt die einzige belastbare Aussage über Halluzinationsraten: Wer Ihnen eine nennt, ohne die Aufgabe dazuzusagen, hat Ihnen nichts gesagt. Für die eigene Anwendung gilt die eigene Messung an den eigenen Unterlagen — deutsche Verträge und Handbücher verhalten sich anders als der englische Benchmark-Korpus, an dem die Ranglisten entstehen.
Was deutsche Gerichte dazu entschieden haben
Die Frage ist in Deutschland nicht mehr theoretisch. Das Kammergericht Berlin hat eine Rechtsanwältin ermahnt, weil ihr Schriftsatz in einer Familiensache Rechtsprechungszitate enthielt, die es nicht gibt — Beschluss vom 20. November 2025, Az. 17 WF 144/25, im Leitsatz als «Erfundene Rechtsprechungszitate in anwaltlichem Schriftsatz» geführt. Die Entscheidung stellt klar, dass die Prüfpflicht beim Anwalt liegt und nicht beim Werkzeug.
Zwei Normen tragen das. Nach § 43a Abs. 3 BRAO unterliegt der Rechtsanwalt der Wahrheitspflicht; ein Verstoß hat berufsrechtliche Folgen. Und nach § 407a Abs. 3 ZPO kann die Vergütung eines Sachverständigen auf 0,00 € gekürzt werden, wenn das Gutachten maßgeblich von einer KI stammt, ohne dass das erklärt wurde. Bundesrechtsanwaltskammer und Deutscher Anwaltverein warnen inzwischen ausdrücklich davor, KI-Ausgaben ungeprüft zu übernehmen.
International ist die Größenordnung eine andere. Die von dem Rechtswissenschaftler Damien Charlotin geführte Datenbank verzeichnete im Mai 2026 rund 1.490 Gerichtsentscheidungen weltweit, über tausend davon in den USA, in denen sich eine Partei auf erfundenes Material gestützt hat. Die Zählungen der Sekundärquellen gehen auseinander, weshalb hier die Größenordnung steht und keine Zahl, die Genauigkeit vortäuscht. Die Richtung ist eindeutig: Die Sanktionen sind von wenigen tausend Dollar im Jahr 2023 auf sechsstellige Beträge gestiegen, und 2026 kommen Suspendierungen und die persönliche Haftung aufsichtführender Partner dazu.
Was tatsächlich hilft
Abschalten lässt sich das nicht — es folgt aus der Bauart. Auf ein Maß drücken, das für Dokumentenarbeit tragfähig ist, lässt es sich sehr wohl. Was dabei trägt, ist nicht die Wahl des Modells, sondern die Architektur um das Modell herum.
Das Modell antwortet nicht aus dem Gedächtnis, sondern aus Abschnitten, die vorher aus Ihren Unterlagen geholt wurden. Jede Aussage bekommt die Fundstelle mit: Seite, Absatz, Dokument. Was sich nicht belegen lässt, wird nicht behauptet.
Der erste Durchgang findet die Stellen, der zweite prüft die Antwort gegen genau diese Stellen. Die meisten erfundenen Klauseln fallen im zweiten Durchgang, weil sie im Text schlicht nicht stehen.
Ein System, das immer antworten muss, erfindet. Eines, das «steht nicht in den Unterlagen» sagen darf, erfindet deutlich seltener. Das ist eine Entwurfsentscheidung, keine Modellfrage.
Beim Menschen. Der Gewinn liegt nicht darin, das Lesen zu ersetzen, sondern darin, von zweihundert Seiten die acht zu finden, die gelesen werden müssen — mit Fundstelle, damit das Nachschlagen Sekunden dauert.
Was dagegen weniger trägt, als oft behauptet wird: ein besserer Prompt. «Erfinde nichts» senkt die Quote messbar und beseitigt sie nicht, weil das Modell nicht weiß, wann es erfindet. Ein Hinweis im Prompt ist eine Bitte, keine Prüfung.
Unsere Messung
Wir behaupten das nicht, wir haben es gemessen. Auf drei öffentlichen Datensätzen, die genau den schwierigen Fall prüfen — Fragen, deren Antwort in mehreren Dokumenten verteilt liegt, also dort, wo einfache Suche Teilantworten liefert und der Rest erfunden wird.
F1-Wert, höher ist besser. Die Zahlen stammen aus unserem eigenen Aufbau und sind auf derARGUS-Seiteim Einzelnen aufgeschlüsselt. Wie das in der Dokumentenarbeit aussieht, steht aufKI-Assistent für Dokumente. Für Ihre eigenen Unterlagen gilt: Der Pilot misst an Ihren Dokumenten, nicht an einem Benchmark-Korpus — genau weil deutsche Verträge sich anders verhalten.
Häufige Fragen
Was ist eine KI-Halluzination?+
Warum halluziniert eine KI überhaupt?+
Wie oft passiert das?+
Lassen sich KI-Halluzinationen vermeiden?+
Hilft ein besserer Prompt?+
Was hat das mit der KI-Verordnung zu tun?+
Prüfen wir es an Ihren eigenen Unterlagen
Die belastbare Antwort auf die Halluzinationsfrage ist eine Messung an Ihren Dokumenten, nicht eine Rangliste. Im Discovery nehmen wir einen echten Vorgang aus Ihrem Haus und zeigen, was belegbar beantwortet wird und was nicht.
Zuletzt aktualisiert: