Fachbeitrag
LLM in bestehendes Projekt integrieren: Rückfallebene
8. Juli 2026 · KI und Daten

„Wir haben ein Vorhaben, das läuft. Da soll jetzt noch KI rein.“ Der Satz kommt selten aus der Entwicklung. Er kommt von jemandem, der einen Termin zu halten hat, und er ist berechtigt: Die Bausteine liegen fertig herum, ein Sprachmodell einzubinden ist schnell erledigt.
Im Normalfall kommt die KI im laufenden Projekt dazu, nachträglich, zu einem Termin, der schon steht. Die Aufgabe heißt dann: ein LLM in ein bestehendes Projekt integrieren.
Das Einbinden ist auch nicht das, woran der Termin scheitert.
Vor dem ersten Lauf mit echten Daten kennt die Trefferquote niemand
Eine Funktion, die eine Rechnungssumme addiert, ist fertig, wenn sie richtig addiert.
Ein Sprachmodell hat diesen Zustand nicht.
Es hat eine Trefferquote, und die kennt vor dem ersten Lauf mit echten Daten niemand, den Anbieter eingeschlossen.
Das ist kein Mangel, das ist die Bauart.
Zum Problem wird es an der Stelle, an der im Projektplan eine Zusage steht, „ab September schlägt das System die Antworttexte vor“, und darunter keine zweite Zeile, die sagt, was im Oktober geschieht, wenn die Vorschläge nicht taugen.
Aus der Annahme wird durch genau eine Zeile ein Bauteil: durch die Rückfallebene, also den Weg, den das System nimmt, wenn die Antwort nicht brauchbar ist. Fehlt sie, hängt der Termin an einer Größe, die vorher niemand kennt.
Die Abschaltprobe ist schnell gemacht und trennt Lieferung von Versuch
Wer ein Sprachmodell einbinden will, streicht es zuerst im Plan durch und liest, was übrig bleibt.
Bleibt ein Ablauf stehen, den jemand freiwillig benutzen würde, dann haben Sie eine Anbindung vor sich: Der Modellteil verbessert etwas, das ohne ihn schon geht.
Bleibt nichts stehen, dann ist das Modell nicht Teil des Vorhabens, sondern das Vorhaben.
Auch das darf man machen.
Es gehört dann in eine eigene Position mit eigenem Deckel und eigener Abbruchbedingung und bekommt keinen Termin im Hauptplan.
Der Unterschied ist keine Wortklauberei. Er ist der Unterschied zwischen einer Lieferung und einem Versuch.
Der Aufwand steckt nicht im Aufruf des Modells
Der Aufruf selbst ist eine Handvoll Zeilen.
Was daneben entsteht, ist gewöhnliche Anwendungsentwicklung: Zustände über mehrere Schritte, Wiederholung nach Zeitüberschreitung, Begrenzung der Rückgabemenge, Abrechnung der Aufrufe, und eine Protokollierung dessen, was hineinging, weil sich ein Fehler sonst nicht nachstellen lässt.
Genau dafür gibt es inzwischen eigene Ablaufsteuerungen, etwa LangGraph.
Man kommt darauf, nachdem man es einmal ohne versucht hat.
Dieser Teil fehlt in fast jeder Schätzung, weil er in der Vorführung nicht vorkommt: Dort läuft jeder Aufruf beim ersten Mal durch.
Neuland sind die Verfahren ohnehin nicht mehr.
Vor der Antwort in den eigenen Unterlagen zu suchen und das Gefundene mitzugeben, ist seit 2020 beschrieben und benannt (Retrieval-Augmented Generation, arXiv:2005.11401, siehe Quellen).
Unbekannt ist in Ihrem Fall nicht das Verfahren, sondern Ihr Bestand, und das ist eine eigene Frage: Ohne Nachführung veraltet jede Antwort.
Eine Änderung an der Anweisung wirkt nie nur an einer Stelle

Die erste Fassung ist immer eine einzige lange Anweisung an das Modell, die alles kann.
Sie trägt, solange die Zahl der Fälle klein ist.
Kommt eine weitere Anforderung dazu, wird ein Satz ergänzt, und danach stimmen Fälle nicht mehr, die mit der Ergänzung nichts zu tun haben.
Wer das ein paar Mal erlebt hat, ändert nichts mehr gern.
Ab da bewegt sich das Vorhaben nicht mehr.
Der Umbau in mehrere kleine Schritte mit je einer Aufgabe kostet mehr als die lange Anweisung.
Er ist der Punkt, ab dem eine Änderung wieder nur an einer Stelle wirkt.
Dass das keine Eigenart einzelner Projekte ist, ist untersucht: Eine Arbeit zur Empfindlichkeit von Sprachmodellen gegenüber der Form der Anweisung (arXiv:2310.11324, siehe Quellen) zeigt, dass allein diese Form, also Trennzeichen und Umbrüche ohne jede Bedeutungsänderung, das Ergebnis bewegt, bei LLaMA-2-13B um bis zu 76 Punkte in der Trefferquote.
Daraus leitet die Arbeit die Empfehlung ab, ein Ergebnis als Bandbreite über mehrere Formen anzugeben statt als einzelnen Wert.
Die Faustregel für den Alltag: Wenn eine Änderung Fälle kippt, die mit ihr nichts zu tun haben, ist der Schritt zu groß geschnitten.
Ein Modell als Prüfer ist ein Filter und keine Abnahme
Wenn die Fälle zu viele werden, liegt der Ausweg nahe, ein zweites Modell die Antworten des ersten bewerten zu lassen.
Das Verfahren ist besser als sein Ruf.
Die Arbeit zu MT-Bench und Chatbot Arena (arXiv:2306.05685, siehe Quellen) misst für starke Modelle als Prüfer über 80 Prozent Übereinstimmung mit menschlichen Urteilen, also dasselbe Niveau, das menschliche Bewerter untereinander erreichen.
Dieselbe Arbeit nennt die Schlagseite: Der Prüfer urteilt je nach Reihenfolge der vorgelegten Antworten unterschiedlich, er bevorzugt die längere Antwort, und er bevorzugt seine eigene.
Daraus folgt eine Arbeitsteilung und keine Abkürzung.
Das Modell sortiert vor, damit niemand tausend Fälle von Hand liest.
Unterschrieben wird von Menschen, an echten Fällen des Kunden.
Was mit den Fällen geschieht, die ein System nicht sicher erledigt, ist der eigentliche Kostenpunkt einer solchen Abnahme.
Dazu gibt es einen eigenen Beitrag: Belege lesen ist leicht, Ausnahmen nicht.
Der Boden bewegt sich, und das gehört in den Plan
Ein nachprüfbares Beispiel, Stand 8. Juli 2026.
Das Model Context Protocol, über das eine Anwendung einem Modell Werkzeuge und Daten anbietet, wird nach Datum versioniert.
Die Fassungsbezeichnung nennt laut Spezifikation den Tag, an dem zuletzt nicht abwärtskompatible Änderungen vorgenommen wurden.
Gültig ist an diesem Tag die Fassung 2025-11-25. Die nächste Fassung, 2026-07-28, liegt seit dem 21. Mai 2026 als Vorabfassung vor. Ob und wann sie verabschiedet wird, entscheidet das Projekt selbst.
Wer diesen Beitrag später liest, prüft den Stand besser selbst.
Genau das ist der Punkt.
Für die Planung heißt das: Fassung festschreiben, den Wechsel als eigene Position einplanen und die Schnittstelle nicht so tief in die Fachlogik hängen, dass ein Fassungswechsel die halbe Anwendung berührt.
Wer das unterlässt, hat eine Abhängigkeit, deren Terminplan jemand anderes macht.
Wo diese Aussage aufhört zu gelten
Sie gilt nicht, wo ein falsches Ergebnis nichts kostet.
Ein Feld, das einen Entwurf vorschlägt, den ohnehin jemand überschreibt, braucht keine ausgearbeitete Rückfallebene: Die Rückfallebene ist das leere Feld.
Und sie gilt nicht für Vorhaben, in denen das Modell die Sache selbst ist.
Dort ist Forschung der richtige Zuschnitt.
Sie muss nur so heißen und so bezahlt werden.
Nicht in diesem Beitrag steht, welches Modell genommen wird und wo es läuft.
Das ist zuerst eine rechtliche und erst danach eine technische Frage: KI im Unternehmen: die drei Fragen vor dem Werkzeug.
Die Abbruchbedingung ist die billigste Zeile im Angebot
Sie ist in wenigen Sätzen gesagt und wird trotzdem fast nie aufgeschrieben.
Der Grund ist nicht Nachlässigkeit.
Wer eine Abbruchbedingung aufschreibt, räumt schriftlich ein, dass die Sache scheitern kann, und das will vor einer Freigabe niemand lesen.
Genau deshalb ist die Frage nach der Abbruchbedingung eine brauchbare Prüffrage vor der Beauftragung.
Fragen Sie den Anbieter, unter welcher Bedingung er selbst zum Abbruch raten würde.
Wer keine nennen kann, hat den Fall nicht durchdacht, oder er rechnet damit, dass Sie ohnehin nicht abbrechen.
Quellen
Quellen zuletzt geprüft am 8. Juli 2026.
- Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks, arXiv:2005.11401, eingereicht am 22. Mai 2020, zuletzt geändert am 12. April 2021. arxiv.org/abs/2005.11401
- Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design, arXiv:2310.11324, eingereicht am 17. Oktober 2023, zuletzt geändert am 1. Juli 2024. Die Angabe „bis zu 76 Punkte“ steht in der Zusammenfassung. arxiv.org/abs/2310.11324
- Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena, arXiv:2306.05685, eingereicht am 9. Juni 2023, zuletzt geändert am 24. Dezember 2023. Die Übereinstimmung über 80 Prozent, das damit erreichte Niveau menschlicher Bewerter untereinander und die genannten Verzerrungen stehen in der Zusammenfassung. arxiv.org/abs/2306.05685
- Model Context Protocol, Abschnitt Versionierung: modelcontextprotocol.io/specification/versioning. Gültige Fassung 2025-11-25: modelcontextprotocol.io/specification/2025-11-25. Vorabfassung 2026-07-28, veröffentlicht am 21. Mai 2026: blog.modelcontextprotocol.io
Nicht durch eine Quelle belegt, sondern eigene Erfahrung: die Beobachtungen zur langen Anweisung und zum Aufwand neben dem Modellaufruf.
Sie stammen aus eigener Projektarbeit und sind beschrieben, nicht gemessen. Kundennamen, Projektzahlen und Referenzen werden dazu nicht genannt.
- Angebot
- Arbeit nach Stundensatz in Ihrer Anwendung
- Satz
- 90 € je Stunde, 720 € je Personentag, netto
- Abruf
- Blöcke ab fünf Personentagen, Vorlauf 3 Wochen
- Vorher schriftlich
- Rückfallebene und Abbruchbedingung
- Autor
- phi ec
info@phiec.de
Schreiben Sie die Rückfallebene auf, bevor Sie beauftragen.
Sagen Sie uns, was das System tun soll und was es tut, wenn die Antwort nicht taugt. Aus diesen beiden Sätzen ergibt sich, ob das ein Auftrag ist oder ein Versuch.