Zum Hauptinhalt springen

Phi Engineering & Consulting

Fachbeitrag

Rechtstexte klassifizieren: Sprachmodell oder Netz?

23. Juli 2026 · KI und Daten

Wand aus Zettelkastenschubladen aus Eiche, die Messingschilder an den Griffen sind leer
Symbolbild. MarkBuckawicki, CC0 1.0, Quelle. Unverändert, nur verkleinert.

Wer Rechtstexte klassifizieren will, also Verträge, Bescheide oder Entscheidungen maschinell vorsortieren, hat zwei Wege: ein kleines Netz auf eigenen Beispielen trainieren oder ein Sprachmodell fragen, ein LLM. Das Sprachmodell gewinnt. Aber nicht bei der Klassifikationsgüte, und die Verwechslung dieser beiden Dinge ist der teuerste Fehler in dieser Entscheidung.

Vorsortieren heißt nicht entscheiden

Vorklassifikation bildet Stapel.

Sie sagt: Das hier ist eine Kündigungsklausel, das eine Haftungsbegrenzung, das gehört zu einem Vorgang, den noch niemand angefasst hat.

Was mit dem Stapel geschieht, entscheidet danach ein Mensch.

§ 2 Absatz 1 RDG: „Rechtsdienstleistung ist jede Tätigkeit in konkreten fremden Angelegenheiten, sobald sie eine rechtliche Prüfung des Einzelfalls erfordert.“

Ein Stapel nach Dokumentart verlangt diese Prüfung nicht.

Der Satz „diese Klausel ist unwirksam“ verlangt sie.

Nach § 3 RDG ist die selbständige Erbringung außergerichtlicher Rechtsdienstleistungen unzulässig, soweit sie nicht ausdrücklich erlaubt wird.

Zwischen beiden Sätzen liegt der gesamte Spielraum.

Der Bundesgerichtshof hat die Grenze an einem Vertragsdokumentengenerator gezogen.

In der Pressemitteilung zum Urteil vom 9. September 2021 heißt es: „Der Nutzer erwartet daher auch keine rechtliche Prüfung seines konkreten Falls.“

Das Werkzeug arbeitete schematisch, wie ein Formularhandbuch.

Genau dieses Schematische trägt einen Vorsortierer, und es ist zugleich seine Obergrenze.

Die KI-Verordnung zieht dieselbe Linie an anderer Stelle.

Anhang III Nummer 8 Buchstabe a stuft KI-Systeme, die eine Justizbehörde „bei der Ermittlung und Auslegung von Sachverhalten und Rechtsvorschriften und bei der Anwendung des Rechts auf konkrete Sachverhalte“ unterstützen sollen, als hochriskant ein.

Artikel 6 Absatz 3 nimmt davon wieder aus, was „eine eng gefasste Verfahrensaufgabe“ oder „eine vorbereitende Aufgabe für eine Bewertung“ erfüllt.

Wer diese Ausnahme in Anspruch nimmt, dokumentiert seine Bewertung nach Artikel 6 Absatz 4, bevor das System in Betrieb geht.

Daraus folgt der Satz, der über die Bauweise entscheidet: Die Ausnahme hängt an der Zweckbestimmung.

Derselbe Vorsortierer fällt heraus, sobald sein Ergebnis übernommen statt gelesen wird, und dafür muss niemand eine Zeile Code ändern.

Warum das Sprachmodell den Anfang gewinnt

In der Praxis heißt die Entscheidung: LLM oder neuronales Netz für die Klassifikation. Entschieden wird sie am Rohstoff, den beide Verfahren verlangen.

Ein neuronales Netz braucht Beispiele, die jemand von Hand einer Klasse zugeordnet hat.

Bei Rechtstexten sind die teuer, und zwar aus vier Gründen gleichzeitig: Zuordnen kann nur, wer die Materie kennt.

Die Klassen sind unscharf, zwei Fachleute sortieren denselben Absatz verschieden.

Die Klassenliste verschiebt sich mit jeder Rechtsänderung.

Und die eine Klasse, auf die es ankommt, ist meistens die seltene, für die deshalb am wenigsten Material vorliegt.

Ein Sprachmodell verlangt statt Beispielen eine Beschreibung der Klasse.

Das ist ein anderer Rohstoff.

Sätze statt Stapel, und die hat die Fachabteilung schon, weil sie ohnehin erklären muss, wonach sie sortiert.

Vier neue Klassen kosten vier Absätze. Beim neuronalen Netz müsste jemand für jede Klasse eine eigene Beispielsammlung von Hand zusammenstellen.

Die Grenze dieses Vorteils ist scharf und wird selten genannt: Die Beschreibung muss trennscharf sein.

Wenn die Fachabteilung sie nicht schreiben kann, hätte sie auch nicht sauber zuordnen können.

Dann liegt das Problem bei der Klassenliste, und kein Verfahren repariert das.

Bei der Klassifikationsgüte verliert es, und das ist belegt

Wand mit mehreren hundert nummerierten Postfächern hinter Messingtüren
Symbolbild. Frank Schulenburg, CC BY-SA 4.0, Quelle. Unverändert, nur verkleinert.

Wer behauptet, ein Sprachmodell klassifiziere besser als ein eigens trainiertes Netz, findet dafür in der Fachliteratur keinen Rückhalt.

Er findet das Gegenteil.

Eine Untersuchung von 2024 (arXiv:2406.08660) hat genau diese Erwartung geprüft und ihr Ergebnis in den Titel geschrieben: Nachtrainierte kleine Modelle schlagen große Modelle im Zero-Shot-Betrieb durchgängig und deutlich, über Stimmungen, Zustimmung, Emotionen und Parteipositionen hinweg.

Für das automatische Erkennen von Vertragsklauseln gilt dasselbe: Der Benchmark CLAUDETTE-ToS kennzeichnet unfaire Klauseln in Nutzungsbedingungen.

Eine Untersuchung von 2025 hat darauf ein nachtrainiertes BERT gegen ein Zero-Shot-Sprachmodell gestellt: 89,20 Prozent F1-Wert gegen 44,12 Prozent.

Das ist eindeutig. Es beantwortet nur die falsche Frage.

Beim Vorsortieren zählt die andere Zahl

Dieselbe Untersuchung nennt die beiden Bestandteile des F1-Werts getrennt.

Für das Zero-Shot-Sprachmodell: Trefferquote 89,32 Prozent, Präzision 29,30 Prozent.

Es findet knapp neun von zehn unfairen Klauseln, und von dem, was es meldet, trifft weniger als ein Drittel zu.

Als Klassifikator ist das schlecht. Als Vorsortierer ist es das gewünschte Verhalten.

Denn ein Vorsortierer darf einen Stapel zu groß machen.

Er darf keinen Fall verlieren.

Die beiden Fehler kosten nicht dasselbe: Ein zu viel gemeldeter Absatz kostet die Lesezeit, die jemand braucht, um ihn wegzulegen.

Ein übersehener kostet den Fall.

Der F1-Wert wiegt beide gleich, und deshalb ist er beim Vorsortieren die falsche Kennzahl.

Wo das kleine Netz gewinnt, und das ist häufig

Bei einer eng gefassten Klasse, die sich nicht verschiebt und für die Beispiele vorliegen, gewinnt das Netz an drei Stellen zugleich.

Es verursacht je Dokument keine Abrufkosten bei einem Anbieter. Was das gegen die Kosten eines Sprachmodells wiegt, rechnen Sie an Ihrem eigenen Mengengerüst nach.

Es ist schneller, weil es auf einem Prozessorkern im eigenen Haus läuft und kein Anbieter im Datenweg steht, was bei Rechtstexten selten eine Nebensache ist.

Und es ist nachvollziehbarer: gleiche Gewichte, gleiche Eingabe, gleiche Ausgabe.

Beim Sprachmodell hängt die Ausgabe auch an der Formulierung der Frage.

Eine Untersuchung von 2023 (arXiv:2310.11324) hat für Formatierungen, die den Sinn nicht verändern, Unterschiede von bis zu 76 Punkten Accuracy gemessen.

Wer nach Artikel 6 Absatz 4 der KI-Verordnung eine Bewertung dokumentieren muss, dokumentiert beim Netz eine Datei und beim Sprachmodell einen Zustand, der sich mit dem nächsten Modellwechsel verschiebt.

Deshalb der Satz, der uns Arbeit kostet: Wenn Sie für eine Klasse genügend sauber zugeordnete Beispiele haben und die Klasse sich nicht ändert, brauchen Sie uns dafür nicht.

Trainieren Sie das kleine Netz.

Das ist ein gelöstes Problem, und es ist billiger als alles, was wir anbieten könnten.

Meistens ist es eine Reihenfolge

Der Weg, der beides verbindet: Das Sprachmodell sortiert vor und liefert nebenbei die zugeordneten Beispiele, die am Anfang gefehlt haben.

Diese Zuordnungen sind Vorschläge.

Sie enthalten Fehler, und zwar die, die aus einer Präzision von 29,30 Prozent folgen.

Ein Mensch prüft je Klasse eine Stichprobe und korrigiert.

Ob und wann daraus ein tragfähiger Bestand wird, hängt vom Dokumentenaufkommen und von der Prüfkapazität ab. Steht er, kann daraus ein kleines Netz entstehen, das den Regelbetrieb prüfbarer macht.

Auch dieser Weg hat seine Bedingung: Er trägt nur bei Klassen, die stabil bleiben.

Verschiebt sich eine Klasse mit jeder Rechtsänderung, veraltet der Beispielbestand schneller, als er wächst.

Dann bleibt es beim Sprachmodell. Für solche Klassen ist das die Dauerlösung.

Fünf Dinge, die Sie ohne uns tun können

  • Schreiben Sie die Klassenliste auf und daneben, was mit jedem Stapel geschieht. Ein Stapel ohne nächsten Schritt braucht keine Klasse.
  • Legen Sie eine Stichprobe von Hand zurecht, ausschließlich zum Nachmessen. Wie groß sie sein muss, hängt davon ab, wie selten die entscheidende Klasse ist. Ohne sie kann Ihnen niemand sagen, ob ein Ergebnis gut ist, wir auch nicht.
  • Beziffern Sie beide Fehler getrennt: was ein zu viel gemeldeter Fall an Lesezeit kostet und was ein übersehener kostet. Das Verhältnis entscheidet die Schwelle.
  • Schreiben Sie einen Satz auf, wer die Ausgabe liest und was damit geschehen darf. Dieser Satz entscheidet über § 2 RDG und über Artikel 6 Absatz 3 der KI-Verordnung.
  • Zählen Sie, wie oft sich die Klassenliste im letzten Jahr geändert hat. Kein Mal spricht für das Netz, mehrmals für das Sprachmodell.

Punkt 2 wird am häufigsten übersprungen, und er ist der einzige, ohne den die anderen vier nichts wert sind.

Wo diese Aussage aufhört zu gelten

Sie gilt für das Vorsortieren.

Sobald jemand die Ausgabe als Entscheidung übernimmt, gilt sie nicht mehr, und dieser Beitrag sagt zu diesem Fall nichts.

Sie ist kein Rechtsrat im Einzelfall.

Ob ein bestimmter Einsatz eine Rechtsdienstleistung ist und ob er unter die Ausnahme des Artikels 6 Absatz 3 fällt, hängt vom Einzelfall ab.

Diese Prüfung gehört in die Hände derer, die dafür zugelassen sind.

Die Zahlen stammen aus je einer Untersuchung auf je einem Benchmark, mit den Modellen ihrer Zeit.

Sie belegen die Richtung.

Für Ihren Bestand belegen sie nichts, dafür gibt es Punkt 2.

Rechtsstand ist der 21. Juli 2026.

Quellen

Quellen zuletzt geprüft am 25. August 2026.

  • § 2 RDG, Begriff der Rechtsdienstleistung, und § 3 RDG, Befugnis zur Erbringung außergerichtlicher Rechtsdienstleistungen.
  • Bundesgerichtshof: Zulässigkeit eines digitalen Vertragsdokumentengenerators, Pressemitteilung Nr. 171/2021 vom 9. September 2021 zum Urteil I ZR 113/20.
  • Verordnung (EU) 2024/1689 (KI-Verordnung), ABl. L, 2024/1689 vom 12. Juli 2024. Zitiert nach der konsolidierten deutschen Fassung auf buzer.de: Artikel 6 und Anhang III.
  • Fine-Tuned „Small“ LLMs (Still) Significantly Outperform Zero-Shot Generative AI Models in Text Classification, arXiv:2406.08660.
  • Text to Trust: Evaluating Fine-Tuning and LoRA Trade-offs in Language Models for Unfair Terms of Service Detection, arXiv:2510.22531.
  • CLAUDETTE: an Automated Detector of Potentially Unfair Clauses in Online Terms of Service, arXiv:1805.01217.
  • Quantifying Language Models‘ Sensitivity to Spurious Features in Prompt Design, arXiv:2310.11324.
Veröffentlicht
23. Juli 2026
Rechtsstand
21. Juli 2026
Normen
§ 2 Abs. 1 und § 3 RDG
KI-Verordnung
VO (EU) 2024/1689, Art. 6 Abs. 3, Anhang III Nr. 8 a
Vergleichssätze
LexGLUE, CLAUDETTE-ToS
Eigene Praxis
Rechtsleitfaden „KI im Unternehmen“, Rheinwerk
Autor
phi ec
info@phiec.de

Schreiben Sie auf, wer den Stapel liest.

Aus diesem einen Satz ergibt sich, ob ein Vorsortierer erlaubt ist und welches Verfahren er braucht. Bringen Sie ihn mit.