Sprachmodelle im Betrieb: kein Text ohne Zahlenprüfung

Tägliche Lage für jeden Nutzer, ein Kurzprofil je Kunde und ein Wochenbericht je Verkäufer, geschrieben von einem lokalen Sprachmodell. Jede Zahl im Text wird gegen die Daten geprüft. Und als die Plattform von KI-Agenten durchgesehen wurde, habe ich die Prüfer geprüft: 3.258 Aussagen, 82 davon falsch.

Rolle
Entwurf, Umsetzung und Betrieb, allein
Zeitraum
seit 09/2026
Stand
10/2026
Umfeld
Plattform aus Projekt A, ohne Cloud-Dienst
Texten in der Stichprobe durch die Zahlenprüfung
46 von 46
Wie gemessen

Jede Zahl in einem erzeugten Text muss in den Daten stehen, aus denen der Text entstanden ist. Ein Text, der das nicht schafft, erscheint nicht.

aktive Kunden mit einem Kurzprofil
616
Wie gemessen

Zahl der Kunden, für die die Plattform ein Kurzprofil aus den eigenen Daten erzeugt. Dazu kommt montags ein Wochenbericht für 16 Verkäufer.

Aussagen aus der Durchsicht durch KI-Agenten nachgeprüft
3.258
Wie gemessen

Die Agenten haben 13 Berichte geschrieben. Ich habe jede Aussage gegen Code und Daten geprüft, bevor daraus Aufgaben wurden.

dieser Aussagen waren falsch, 311 ungenau
82
Wie gemessen

Ergebnis der Nachprüfung. Die falschen Aussagen sind nicht ins Board gekommen, die ungenauen erst nach Korrektur.

Ausgangslage

Die Plattform aus Projekt A zeigt viele Zahlen auf vielen Seiten. Wer morgens wissen will, was sich geändert hat, muss sie selbst zusammensuchen. Ein Sprachmodell kann das zusammenfassen. Es kann dabei auch eine Zahl erfinden, die plausibel klingt. In einem Unternehmen, das nach diesen Zahlen einkauft und schlachtet, ist eine erfundene Zahl schlimmer als gar kein Text.

Dazu kam eine zweite Frage. KI-Agenten können eine ganze Plattform durchsehen und Berichte schreiben. Wie viel davon stimmt?

Entscheidung

Erstens: Das Modell läuft lokal, auf einem Arbeitsplatzrechner mit Grafikkarte. Keine Kundendaten verlassen das Haus. Welches Modell es ist, habe ich vorher gemessen. Den Vergleich beschreibe ich auf der Seite Arbeitsweise.

Zweitens: Das Modell schreibt, aber es zählt nicht. Die Zahlen kommen aus der Plattform. Das Modell bekommt sie als Kontext und formuliert den Text. Danach prüft eine Regel jede Zahl im Text gegen diesen Kontext. Passt eine nicht, erscheint der Text nicht.

Drittens: Was das Modell nicht zuverlässig kann, macht es nicht. Wenn ein Fall zeigt, dass ein Satz falsch werden kann, kommt dieser Satz künftig aus festem Code.

Viertens: Berichte von Agenten sind Hinweise, keine Befunde. Jede Aussage wird nachgeprüft, bevor daraus Arbeit entsteht.

Umsetzung

Die Startseite zeigt jedem Nutzer täglich, was neu ist, was offen bleibt und was sich erledigt hat. Die Liste ist nach seinen Rechten und seinen Kunden gefiltert. Darüber steht eine Kurzfassung aus dem Sprachmodell, deren Zahlen gegen die Liste geprüft sind. Zum Start sahen 39 von 42 Nutzern diese Lage.

Für den Vertrieb gibt es zwei Texte. Jeder der 616 aktiven Kunden hat ein Kurzprofil auf seiner Kundenseite. 16 Verkäufer bekommen montags einen Wochenbericht: Umsatz gegen den eigenen Schnitt und die Vorjahreswoche, die stärksten Zuwächse und Rückgänge je Kunde, offene Hinweise. In einer Stichprobe haben 46 von 46 Texten die Zahlenprüfung bestanden.

Ein Fall ist trotzdem aufgefallen. Ein Text sagte „keine Hinweise”, obwohl zwei vorlagen. Keine Zahl war falsch, also hat die Prüfung nicht angeschlagen. Ich habe das nicht mit einer zweiten Prüfung geflickt. Der Satz über die Hinweise kommt jetzt gar nicht mehr vom Modell, sondern aus der Plattform selbst.

Ende September habe ich die ganze Plattform durchsehen lassen: Funktionen, Oberfläche, Dienst, Sicherheit, Leistung, Daten und Modelle, Betrieb. Parallel arbeitende KI-Agenten haben dazu 13 Berichte geschrieben. Ich habe alle 3.258 Aussagen darin nachgeprüft. 82 waren falsch, 311 ungenau. Erst danach kamen rund 40 Aufgaben ins Board, 2 davon kritisch. Ein Lasttest gehörte dazu: Bis 30 gleichzeitige Nutzer lief die Plattform fehlerfrei, und der Engpass ist benannt.

Agenten setze ich auch beim Bauen ein. An einem Abend im September haben 20 Agenten parallel an Aufgaben gearbeitet, jeder in einem eigenen Bereich von Dateien, damit sie sich nicht gegenseitig überschreiben. Urteil und Abnahme blieben bei mir: Tests, Sichtprüfung, Abgleich mit den echten Daten.

Ergebnis mit Messung

Messung Wert
Texte in der Stichprobe durch die Zahlenprüfung 46 von 46
Kunden mit Kurzprofil 616
Verkäufer mit Wochenbericht 16
Aussagen der Agenten nachgeprüft 3.258
davon falsch 82
davon ungenau 311

Die Zahlenprüfung hält, was sie verspricht: Kein Text mit einer Zahl, die nicht in den Daten steht. Sie hält nicht alles ab. Der Fall mit den Hinweisen zeigt, dass ein Text ohne falsche Zahl trotzdem falsch sein kann. Darum wandert jeder Satz, der so einen Fehler gezeigt hat, aus dem Modell in festen Code.

Bei den Agenten ist das Ergebnis eindeutig. Ungeprüft wären 82 falsche und 311 ungenaue Aussagen als Aufgaben ins Board gekommen. Die Nachprüfung ist kein Zusatz, sie ist der eigentliche Arbeitsschritt.

Was ich nicht gemessen habe: ob die Texte gelesen werden und ob sie Entscheidungen ändern. Ich behaupte deshalb nichts dazu.

Was ich anders machen würde

Die Liste der Sätze, die nie vom Modell kommen dürfen, von Anfang an führen. Aussagen über das Fehlen von etwas gehören dazu. Ein Modell sagt leicht „nichts”, und keine Zahlenprüfung merkt es.

Die Stichprobe größer und regelmäßig machen. 46 Texte sind ein guter Anfang, aber eine einmalige Messung.

Den Agenten vorher sagen, wie sie belegen sollen. Eine Aussage mit Fundstelle im Code oder in den Daten lässt sich in Minuten prüfen. Eine ohne Fundstelle muss ich erst suchen.

Technik

  • Lokales Sprachmodell
  • Python
  • FastAPI
  • React
  • KI-Agenten