Prognosen im Entscheidungsprotokoll prüfen
Kurzfassung: KI-Systeme können Wahrscheinlichkeiten für künftige Ereignisse nennen. Ob diese Einschätzungen einem Unternehmen helfen, zeigt kein allgemeiner Ranglistenplatz. Dafür müssen Führungskräfte ihre eigene Prognose und die KI-Zweitmeinung vorab festhalten, später mit dem tatsächlichen Ausgang vergleichen und den Nutzen der daraufhin getroffenen Entscheidung gesondert bewerten.
Ein Budget wird beschlossen, ein Projekttermin zugesagt, eine Kapazität eingeplant. Oft lässt sich Monate später noch sagen, wer entschieden hat. Schwerer ist die Frage, was die Beteiligten vorher für wahrscheinlich hielten. Genau dort beginnt ein sinnvoller Test von KI als Prognosehilfe: nicht mit der Frage, ob ein Modell „besser als Manager“ ist, sondern mit zwei vergleichbaren Einschätzungen zu derselben präzise formulierten Frage.
Ein Benchmark ist noch kein Unternehmensnachweis
Im Moonshots-Gespräch über KI-Prognosen fällt der Name ForecastBench. Das Forschungsprojekt sammelt Fragen zu künftigen Ereignissen, erfasst Wahrscheinlichkeitsprognosen und wertet sie aus, sobald die Ergebnisse feststehen. Es vergleicht dabei auch Modelle mit menschlichen Vorhersagen. Die ursprüngliche Studie fand für ihre damalige Stichprobe einen statistisch signifikanten Vorsprung erfahrener menschlicher Prognostiker gegenüber dem besten getesteten Modell. Das ist keine Aussage über jedes heute verfügbare System. Die Benchmark-Dokumentation beschreibt eine laufend aktualisierte Auswertung und eine angepasste Wertungsmethode für Teilnehmer, die unterschiedliche Fragesätze beantworten.
Eine pauschale Aussage, KI habe menschliche Experten endgültig eingeholt oder ersetzt, lässt sich aus der ursprünglichen Studie nicht ableiten. Erst recht folgt aus öffentlichen Fragen nicht, dass ein Modell die Nachfrage eines bestimmten Kunden oder die Lieferfähigkeit eines Betriebs zuverlässig einschätzt. Die Managementfrage ist enger: Verbessert eine zusätzliche, dokumentierte Prognose die eigene Entscheidung unter den tatsächlich vorhandenen Informationen?
Die Frage muss vor dem Ergebnis stehen
Ein Unternehmen kann mit wenigen wiederkehrenden Fragen beginnen. „Wird dieses Projekt bis zum vertraglichen Termin abgenommen?“ ist prüfbarer als „Läuft das Projekt gut?“. Vor dem Termin werden die Frage, die Informationslage und eine Wahrscheinlichkeit erfasst: etwa die Einschätzung der verantwortlichen Person und unabhängig davon die Antwort eines KI-Systems. Beide müssen dieselbe Definition und denselben Stichtag erhalten. Auch die Quelle für das spätere Ergebnis wird vorher bestimmt.
Sobald der Fall abgeschlossen ist, wird nicht nur festgehalten, ob die Prognose richtig oder falsch war. Eine 70-Prozent-Aussage kann auch bei einem einzelnen Misserfolg vernünftig gewesen sein. Über viele vergleichbare Fälle lässt sich prüfen, ob Ereignisse mit einer angegebenen Wahrscheinlichkeit ungefähr so häufig eintreten. ForecastBench verwendet für binäre Ereignisse unter anderem den Brier-Wert: Er misst den quadratischen Abstand zwischen der genannten Wahrscheinlichkeit und dem späteren Ausgang; niedriger ist besser. Bei kleinen Fallzahlen oder stark wechselnden Bedingungen ist ein solcher Vergleich jedoch unsicher.
Das Protokoll muss auch Fälle enthalten, in denen niemand die KI-Zweitmeinung überzeugend fand. Werden nur auffällige Treffer gesammelt, entsteht ein Schaufenster statt einer Bewertung. Modellversion, verwendete Daten und Zeitpunkt gehören deshalb zur Aufzeichnung. Später nachgeschobene Informationen dürfen die ursprüngliche Prognose nicht stillschweigend überschreiben.
Treffgenauigkeit ist nicht gleich Entscheidungsgüte
Selbst eine gut kalibrierte Prognose entscheidet nicht, was zu tun ist. Wenn eine verspätete Lieferung ein Kundenwerk stilllegt, kann schon ein mäßiges Risiko einen teuren Puffer rechtfertigen. Bei einem leicht verschiebbaren internen Termin wäre dieselbe Wahrscheinlichkeit womöglich kein Grund zum Eingreifen. Schadenshöhe, Alternativen und Kosten gehören neben die Vorhersage, nicht in sie hinein.
Für eine Geschäftsführung heißt das: Zuerst wird die Prognosequalität getestet, dann die Qualität der daraus abgeleiteten Maßnahmen. Ein Modell könnte einen Terminverzug häufiger erkennen, aber so viele unnötige Eskalationen auslösen, dass der Gesamteffekt negativ ist. Umgekehrt kann eine zusätzliche Warnung wirtschaftlich wertvoll sein, obwohl sich der durchschnittliche Prognosewert nur wenig verbessert.
Der praktische Einstieg ist daher ein begrenzter Pilot: wiederkehrende, klar auflösbare Ereignisse wählen, menschliche und maschinelle Einschätzungen vorab getrennt festhalten und nach mehreren Zyklen gemeinsam auswerten. Erst dann lässt sich entscheiden, ob KI im Planungsprozess eine feste Zweitmeinung liefern sollte. Die Verantwortung für Budget, Zusage oder Eingriff bleibt auch mit besserer Prognose bei den Menschen, die Folgen und Alternativen beurteilen müssen.
← Zurück zum Blog