Typisierte Entscheidungen brauchen eigene Fehlerschwellen
Kurzfassung: Ein Modell kann eine Serviceanfrage einer Kategorie zuordnen und zugleich eine Wahrscheinlichkeit ausgeben. Ob daraus automatisch eine Gutschrift, ein Vorgang oder nur eine Prüfaufgabe wird, entscheidet jedoch das Unternehmen. Der neue Steuerungspunkt liegt zwischen maschineller Einordnung und wirksamer Handlung: Für jede Fallklasse braucht es eine geprüfte Fehlerschwelle und einen Rückweg zum Menschen.
In vielen KI-Projekten wird die Qualität am fertigen Text gemessen. Im laufenden Betrieb fallen aber auch tausende kleinere Entscheidungen an: Welches Team erhält ein Anliegen? Ist ein Fall dringlich? Darf eine Anfrage ohne weitere Prüfung weitergeleitet werden? TypeSafe AI stellte im September mit Jev ein Modell vor, das für solche Aufgaben keine freie Antwort formuliert, sondern vorgegebene Auswahl-, Bewertungs- und Wahrscheinlichkeitswerte zurückgibt. Das ist eine konkrete technische Entwicklung, kein Beleg dafür, dass die vorgeschlagenen Entscheidungen bereits fachlich richtig oder wirtschaftlich günstiger sind.
Eine gültige Ausgabe ist noch kein gültiger Beschluss
Die Dokumentation von TypeSafe unterscheidet drei Formen: „Choice“ wählt eine vorgegebene Option, „Score“ ordnet einen Fall auf einer festgelegten Skala ein, „Noul“ beantwortet eine Ja-Nein-Frage mit einer Wahrscheinlichkeit. Mehrere eng umrissene Fragen können auf denselben Sachverhalt angewandt werden. Ein Programm kann diese Antworten direkt für eine Verzweigung nutzen.
Damit entfällt ein Teil der Unsicherheit beim Auslesen freier Texte. Die Kategorie „Rechnung“ kann formal zu einem passenden Fachteam führen, ohne dass erst eine Formulierung interpretiert werden muss. Doch Typkorrektheit sagt nichts über die fachliche Zuordnung. Eine doppelte Abbuchung kann zugleich ein Rechnungsfall, eine Beschwerde und eine Fristsache sein. Ein System, das nur eine dieser Dimensionen kennt, kann syntaktisch vollkommen richtig und betrieblich gefährlich handeln.
Auch ein hoher angegebener Konfidenzwert ist keine Freigabe. Ob 90 Prozent in einer bestimmten Fallgruppe tatsächlich ungefähr neun von zehn korrekten Zuordnungen entsprechen, lässt sich nur mit geeigneten, laufend überprüften Referenzfällen feststellen. Die Herstellerangaben zu Geschwindigkeit, Kosten und Kalibrierung ersetzen keinen solchen Nachweis im eigenen Prozess.
Der Fehler hat je nach Handlung einen anderen Preis
Ein Beispiel aus dem Kundenservice zeigt den entscheidenden Unterschied. Wird ein Anliegen zunächst nur einem Team zugeordnet, ist ein Fehler oft durch Weiterleitung korrigierbar. Wird aufgrund derselben Einordnung eine Erstattung ausgelöst oder eine Vertragszusage versendet, entstehen Geld- und Außenwirkungen. Für die erste Handlung kann eine andere Schwelle gelten als für die zweite. Unklare Fälle gehen an eine Fachkraft; für irreversible oder sensible Entscheidungen kann eine ausdrückliche Freigabe erforderlich bleiben.
Das Unternehmen muss deshalb nicht einfach „das beste Modell“ auswählen. Es muss für jeden Entscheidungspunkt definieren, welche Eingaben zulässig sind, welche Antwortklassen es gibt und was eine falsch positive oder falsch negative Entscheidung kostet. Bei einer Eskalation kann eine übersehene Dringlichkeit teurer sein als eine unnötige Weiterleitung. Bei einer Gutschrift verschiebt sich das Verhältnis. Derselbe Zahlenwert kann nicht beide Entscheidungen pauschal steuern.
Hier erhält fachliches Wissen eine andere Form. Die Serviceleitung legt fest, welche Fälle überhaupt automatisch weiterlaufen dürfen. Qualitätssicherung hält Grenzfälle und tatsächliche Fehlzuordnungen fest. IT verbindet die Ausgabe mit klar begrenzten Aktionen und sorgt dafür, dass bei Ausfall oder unsicherem Ergebnis nicht stillschweigend der nächste Schritt erfolgt. Die Verantwortung wandert nicht zum Klassifikationsmodell; sie wird an der Stelle sichtbar, an der eine Einordnung zur Handlung wird.
Zuerst die Entscheidungsspur, dann der automatische Zweig
Ein begrenzter Test kann mit einer häufigen, zunächst folgenarmen Entscheidung beginnen: etwa der Zuordnung eingehender Servicefälle zu Fachgruppen. Historische Fälle allein reichen dafür nicht, wenn sie frühere Fehlzuordnungen enthalten. Fachkräfte sollten eine Stichprobe unabhängig bewerten und Fälle mit mehreren plausiblen Kategorien gesondert markieren. Danach lässt sich im Nebenlauf vergleichen, wann das System richtig liegt, wann es unsicher ist und welche Arten von Fehlern trotz hoher Konfidenz auftreten.
Erst aus dieser Verteilung ergibt sich eine brauchbare Schwelle. Zu beobachten sind nicht nur die Trefferrate, sondern Fehlerraten je Fallklasse, unnötige Eskalationen, Bearbeitungszeit nach Fehlleitung und Aufwand für menschliche Prüfung. Änderungen an Kategorien, Modellversion oder Eingangsdaten verlangen einen erneuten Vergleich. Ein vermeintlich günstiger Modellaufruf rechnet sich nicht, wenn er zusätzliche Nacharbeit oder verlorene Kundenzeit erzeugt.
Für das KI-Management ist das eine engere, aber nützlichere Frage als die allgemeine Debatte über Automatisierung: Welche kleine Entscheidung darf unter welchen nachgewiesenen Bedingungen den nächsten Schritt auslösen? Typisierte Modelle machen diese Stelle technisch leicht anschließbar. Die fachliche Grenze zwischen Vorschlag und Handlung muss die Organisation selbst bestimmen.
← Zurück zum Blog