Clef · Live-Demo ausprobieren →
Halluzinationen

Erfindet die Maschine eine Klausel?

Das ist der Einwand, der vor jedem Vertrag steht, den jemand von einer Maschine prüfen lassen will. Er ist berechtigt. Eine Halluzination ist eine Ausgabe, die sprachlich einwandfrei und inhaltlich erfunden ist — ein Aktenzeichen, das es nicht gibt, ein Paragraf, der anders lautet, eine Klausel, die im Vertrag nicht steht. Sie fällt nicht auf, weil sie genau wie das Echte klingt.

Der Grund liegt in der Bauart. Ein Sprachmodell berechnet Wahrscheinlichkeiten über Zeichenfolgen; es fragt keine Datenbank ab und hat keinen Begriff davon, ob etwas existiert. Wo eine Information fehlt, entsteht an ihrer Stelle etwas, das aussieht wie die Information. Je spezifischer die Frage, desto plausibler die Erfindung — und juristische Fragen sind maximal spezifisch.

Wie oft — und warum eine Zahl nichts sagt

Nach der Häufigkeit wird am zweithäufigsten gefragt, und die Antwort ist unbequem: Zwischen den Messungen liegen zwei Größenordnungen, weil sie verschiedene Aufgaben messen.

< 1,5 %
Einfache Zusammenfassung eines vorgelegten Textes, Spitzenmodelle.
4,6–6,1 %
Frontier-Modelle 2026 über einen gemischten Korpus.
> 33 %
Aufgaben mit mehrstufiger Schlussfolgerung.
58–88 %
Juristische Anfragen an allgemeine Modelle — Messung von Stanford RegLab und HAI.

Daraus folgt die einzige belastbare Aussage über Halluzinationsraten: Wer Ihnen eine nennt, ohne die Aufgabe dazuzusagen, hat Ihnen nichts gesagt. Für die eigene Anwendung gilt die eigene Messung an den eigenen Unterlagen — deutsche Verträge und Handbücher verhalten sich anders als der englische Benchmark-Korpus, an dem die Ranglisten entstehen.

Was deutsche Gerichte dazu entschieden haben

Die Frage ist in Deutschland nicht mehr theoretisch. Das Kammergericht Berlin hat eine Rechtsanwältin ermahnt, weil ihr Schriftsatz in einer Familiensache Rechtsprechungszitate enthielt, die es nicht gibt — Beschluss vom 20. November 2025, Az. 17 WF 144/25, im Leitsatz als «Erfundene Rechtsprechungszitate in anwaltlichem Schriftsatz» geführt. Die Entscheidung stellt klar, dass die Prüfpflicht beim Anwalt liegt und nicht beim Werkzeug.

Zwei Normen tragen das. Nach § 43a Abs. 3 BRAO unterliegt der Rechtsanwalt der Wahrheitspflicht; ein Verstoß hat berufsrechtliche Folgen. Und nach § 407a Abs. 3 ZPO kann die Vergütung eines Sachverständigen auf 0,00 € gekürzt werden, wenn das Gutachten maßgeblich von einer KI stammt, ohne dass das erklärt wurde. Bundesrechtsanwaltskammer und Deutscher Anwaltverein warnen inzwischen ausdrücklich davor, KI-Ausgaben ungeprüft zu übernehmen.

International ist die Größenordnung eine andere. Die von dem Rechtswissenschaftler Damien Charlotin geführte Datenbank verzeichnete im Mai 2026 rund 1.490 Gerichtsentscheidungen weltweit, über tausend davon in den USA, in denen sich eine Partei auf erfundenes Material gestützt hat. Die Zählungen der Sekundärquellen gehen auseinander, weshalb hier die Größenordnung steht und keine Zahl, die Genauigkeit vortäuscht. Die Richtung ist eindeutig: Die Sanktionen sind von wenigen tausend Dollar im Jahr 2023 auf sechsstellige Beträge gestiegen, und 2026 kommen Suspendierungen und die persönliche Haftung aufsichtführender Partner dazu.

Was tatsächlich hilft

Abschalten lässt sich das nicht — es folgt aus der Bauart. Auf ein Maß drücken, das für Dokumentenarbeit tragfähig ist, lässt es sich sehr wohl. Was dabei trägt, ist nicht die Wahl des Modells, sondern die Architektur um das Modell herum.

Antwort an die Quelle binden

Das Modell antwortet nicht aus dem Gedächtnis, sondern aus Abschnitten, die vorher aus Ihren Unterlagen geholt wurden. Jede Aussage bekommt die Fundstelle mit: Seite, Absatz, Dokument. Was sich nicht belegen lässt, wird nicht behauptet.

Zwei Durchgänge statt einem

Der erste Durchgang findet die Stellen, der zweite prüft die Antwort gegen genau diese Stellen. Die meisten erfundenen Klauseln fallen im zweiten Durchgang, weil sie im Text schlicht nicht stehen.

Fehlende Antwort zulassen

Ein System, das immer antworten muss, erfindet. Eines, das «steht nicht in den Unterlagen» sagen darf, erfindet deutlich seltener. Das ist eine Entwurfsentscheidung, keine Modellfrage.

Die Prüfung dort lassen, wo sie hingehört

Beim Menschen. Der Gewinn liegt nicht darin, das Lesen zu ersetzen, sondern darin, von zweihundert Seiten die acht zu finden, die gelesen werden müssen — mit Fundstelle, damit das Nachschlagen Sekunden dauert.

Was dagegen weniger trägt, als oft behauptet wird: ein besserer Prompt. «Erfinde nichts» senkt die Quote messbar und beseitigt sie nicht, weil das Modell nicht weiß, wann es erfindet. Ein Hinweis im Prompt ist eine Bitte, keine Prüfung.

Unsere Messung

Wir behaupten das nicht, wir haben es gemessen. Auf drei öffentlichen Datensätzen, die genau den schwierigen Fall prüfen — Fragen, deren Antwort in mehreren Dokumenten verteilt liegt, also dort, wo einfache Suche Teilantworten liefert und der Rest erfunden wird.

HotpotQA
mehrstufige Suche
einfache Suche 38
ARGUS 83,1
MuSiQue
Ketten über drei bis vier Schritte
einfache Suche 20
ARGUS 68,4
2WikiMultiHopQA
zusammengesetzte Fragen
einfache Suche 42
ARGUS 89,2

F1-Wert, höher ist besser. Die Zahlen stammen aus unserem eigenen Aufbau und sind auf derARGUS-Seiteim Einzelnen aufgeschlüsselt. Wie das in der Dokumentenarbeit aussieht, steht aufKI-Assistent für Dokumente. Für Ihre eigenen Unterlagen gilt: Der Pilot misst an Ihren Dokumenten, nicht an einem Benchmark-Korpus — genau weil deutsche Verträge sich anders verhalten.

Häufige Fragen

Was ist eine KI-Halluzination?+
Eine Ausgabe, die sprachlich einwandfrei und inhaltlich erfunden ist. Das Modell sagt nicht die Unwahrheit im menschlichen Sinn — es setzt das wahrscheinlichste nächste Wort, und wo es nichts weiß, ist das wahrscheinlichste Wort trotzdem ein Wort. Deshalb klingen erfundene Aktenzeichen, Paragrafen und Klauseln genau wie echte.
Warum halluziniert eine KI überhaupt?+
Weil ein Sprachmodell Wahrscheinlichkeiten über Zeichenfolgen berechnet und keine Datenbank abfragt. Es hat keinen Begriff davon, ob etwas existiert. Fehlt eine Information, entsteht an ihrer Stelle etwas, das so aussieht wie die Information — und je spezifischer die Frage, desto plausibler die Erfindung.
Wie oft passiert das?+
Das hängt vollständig von der Aufgabe ab, und deshalb ist eine einzelne Zahl irreführend. Bei einfachen Zusammenfassungen liegen Spitzenmodelle unter 1,5 %. Bei mehrstufigen Schlussfolgerungen über 33 %. Bei juristischen Anfragen an allgemeine Modelle maßen Stanford RegLab und HAI 58 bis 88 %. Wer Ihnen 3 % nennt, zitiert einen Zusammenfassungs-Benchmark.
Lassen sich KI-Halluzinationen vermeiden?+
Vollständig abschalten lassen sie sich nicht — sie folgen aus der Bauart. Auf ein Maß drücken, das für Dokumentenarbeit tragfähig ist, lassen sie sich sehr wohl: indem die Antwort an belegte Stellen gebunden wird, indem ein zweiter Durchgang gegen dieselben Stellen prüft, und indem das System «steht nicht in den Unterlagen» sagen darf.
Hilft ein besserer Prompt?+
Etwas, aber nicht genug. «Erfinde nichts» senkt die Quote messbar und beseitigt sie nicht, weil das Modell nicht weiß, wann es erfindet. Was trägt, ist die Architektur: Belegpflicht, Nachprüfung, erlaubte Leerantwort.
Was hat das mit der KI-Verordnung zu tun?+
Unmittelbar wenig, mittelbar viel. Die Verordnung verlangt bei Systemen mit hohem Risiko menschliche Aufsicht und Nachvollziehbarkeit. Ein System, das seine Aussagen mit Fundstelle ausgibt, erfüllt beides nebenbei — die Aufsicht kann prüfen, weil es etwas zu prüfen gibt.

Prüfen wir es an Ihren eigenen Unterlagen

Die belastbare Antwort auf die Halluzinationsfrage ist eine Messung an Ihren Dokumenten, nicht eine Rangliste. Im Discovery nehmen wir einen echten Vorgang aus Ihrem Haus und zeigen, was belegbar beantwortet wird und was nicht.

Zuletzt aktualisiert: