Die meisten Entscheidungen für einen KI-Anbieter fallen nach einer Demo, und die ist so ziemlich das schwächste Signal, das Sie bekommen können. Eine Demo beweist, dass ein Modell eine Aufgabe einmal lösen kann, unter Bedingungen, die der Anbieter gewählt hat. Sie kaufen aber das System, das dieselbe Aufgabe zehntausendmal löst, unter Bedingungen, die er nicht gewählt hat. Die folgenden neun Fragen trennen das eine vom anderen. Zu jeder steht, was sie im Kern prüft und wie die ausweichende Antwort klingt.
Die Fragen sind wichtig, weil die Ausgangslage schlecht ist: 95 % der generativen KI-Pilotprojekte in Unternehmen haben keinen messbaren Effekt auf die Gewinn- und Verlustrechnung (MIT Project NANDA, 2025). Dieselbe Studie zeigt auch, was besser abschneidet: Der Einkauf bei spezialisierten Anbietern oder die Partnerschaft mit ihnen war in etwa 67 % der Fälle erfolgreich, rund dreimal so oft wie Eigenentwicklungen. Die Zusammenarbeit mit einem Partner funktioniert. Eine schlechte Zusammenarbeit macht den größten Teil der 95 % aus.
1. Was haben Sie in den Produktivbetrieb gebracht, und was leistet es heute?
Gemeint ist nicht, was der Anbieter gebaut hat, sondern was heute läuft und wovon Nutzer abhängen. Fragen Sie nach dem Workflow, nach dem Volumen und danach, wie lange das System schon live ist.
Schwache Antwort: ein Portfolio aus Piloten, Prototypen und Machbarkeitsnachweisen, beschrieben in der Vergangenheitsform. Vorführen kann jeder. Die eigentliche Leistung besteht darin, ein System auszuliefern und am Laufen zu halten, und ein Anbieter, der das getan hat, kann Einzelheiten nennen. Unsere stehen unter Referenzen, jeweils mit Investition und Ertrag.
2. Wer genau macht die Arbeit, und lerne ich diese Personen vor der Unterschrift kennen?
Die meisten Projekte laufen an der Lücke zwischen den Menschen im Pitch und den Menschen an der Tastatur schief. Fragen Sie nach Namen, nach der Erfahrung und danach, ob diese Personen gleichzeitig für andere Kunden arbeiten.
Schwache Antwort: „unser Team“, ein Organigramm oder ein Partner, der „nah am Projekt bleibt“. Wenn nicht dieselben Leute das Projekt abgrenzen und umsetzen, wird jedes Stück Kontext, das Sie weitergeben, noch einmal weitergegeben. Das ist das ganze Argument für das Forward-Deployed-Modell (Englisch), bei dem die Engineers direkt in Ihrem Team arbeiten.
3. Wie hoch ist der Gesamtpreis, und wer trägt eine Überschreitung?
Eine Zahl, schriftlich, und dazu die Antwort auf die Frage, was passiert, wenn es länger dauert. Mit keiner anderen Frage auf dieser Liste lassen sich Vertragsmodelle so schnell sortieren.
Schwache Antwort: eine Liste mit Stundensätzen, eine Spanne oder „das hängt vom Umfang ab“. Es hängt immer vom Umfang ab. Die Frage ist, wer dieses Risiko trägt. Den Mechanismus dahinter haben wir im Artikel Bait-and-Bill (Englisch) beschrieben, und unsere eigenen Preise sind veröffentlicht, damit Sie uns am selben Maßstab messen können.
4. Woran erkennen wir, dass es funktioniert?
Sie suchen eine Kennzahl und ein Messverfahren, am besten vor der Entwicklung vereinbart. Genauigkeit auf welchem Testdatensatz? Lösungsquote gegenüber welchem Ausgangswert? Wer misst, und wie oft?
Schwache Antwort: qualitative Ergebnisse, Nutzungszahlen oder „den Erfolg definieren wir gemeinsam in der Discovery-Phase“. Ein Unternehmen, das beruflich KI entwickelt, hat eine Meinung dazu, wie man sie misst. Genau das ist eine Eval-Suite (Englisch). Wer zu Ihrer keine Vorstellung hat, verrät damit einiges.
5. Was passiert, wenn das Modell falschliegt?
Jedes probabilistische System macht Fehler. Sie prüfen, ob der Anbieter über den Fehlerfall nachgedacht hat, bevor Sie gefragt haben: Leitplanken, Eskalationswege, Kontrollpunkte mit Menschen und das Ausmaß des Schadens an einem schlechten Tag.
Schwache Antwort: „das Modell ist sehr genau“ oder alles, was Zuverlässigkeit als Eigenschaft des Modells behandelt statt als Eigenschaft des Systems drumherum. Die richtige Antwort beschreibt Beschränkungen im Code, nicht Vertrauen in die Benchmarks eines Anbieters.
6. Was passiert, wenn sich das zugrunde liegende Modell ändert?
Modellanbieter stellen Versionen ein, justieren nach und ändern das Verhalten nach ihrem eigenen Zeitplan. Fragen Sie, was dann bricht, wie der Anbieter davon erfährt und wie schnell er zurückrollen könnte.
Schwache Antwort: ein ratloser Blick oder die Behauptung, modellunabhängig zu sein, ohne dass etwas dahintersteht. Die glaubwürdige Antwort enthält festgelegte Modellversionen, versionierte Prompts, eine Regressions-Suite und einen Rückweg zu einem Stand, der nachweislich funktioniert hat. Diese Schichten beschreiben wir im Artikel zum Stack für produktive Agenten (Englisch).
7. Wem gehören der Code, die Prompts und die Evals?
Fragen Sie ausdrücklich nach allen dreien, dazu nach der Infrastruktur und den Daten. Prompts und Eval-Datensätze sind das gesammelte Wissen des Projekts, und sie sind der Teil, den Anbieter am ehesten stillschweigend behalten.
Schwache Antwort: Eigentum an den „Deliverables“ oder Eigentum am Code, während die Orchestrierung auf der Plattform des Anbieters liegt. Wenn ein Wechsel bedeutet, alles neu zu bauen, dann gehört zum Preis des Projekts, dass Sie nie wechseln.
8. Was kostet der Betrieb nach dem Start, und wer übernimmt ihn?
KI-Systeme im Live-Betrieb driften, und jemand muss sie beobachten. Fragen Sie nach dem monatlichen Betrag und danach, wer dafür verantwortlich ist.
Schwache Antwort: den Betrieb als optional oder als Support-Paket zu behandeln. Die Inferenz selbst ist günstig, sie kostet Cent-Beträge pro Vorgang und wird schnell günstiger. Monitoring, Eval-Regressionen und der Umgang mit Drift sind dagegen echte Arbeit. Bei uns kostet das 3.000–20.000 $ pro Monat, je nachdem, wie viele Systeme wir betreuen. Wir nennen den Betrag lieber vorab, als dass er später auftaucht.
9. Wann würden Sie uns raten, das nicht zu bauen?
Die aufschlussreichste Frage auf der Liste, und die, die fast niemand stellt. Sie prüfen, ob der Anbieter überhaupt eine Haltung dazu hat, wann etwas passt, oder ob sich zufällig jedes Problem mit dem lösen lässt, was er verkauft.
Schwache Antwort: Begeisterung. Ein Anbieter, den zu beauftragen sich lohnt, nennt die Bedingungen, unter denen Sie nicht weitermachen sollten: Die Daten fehlen, der Workflow hat zu wenig Volumen, die richtige Antwort lässt sich nicht bestimmen, niemand ist für die Kennzahl verantwortlich. Wenn er noch nie einem Kunden von etwas abgeraten hat, sind Sie nicht sein Kunde, sondern seine Vertriebspipeline.
So nutzen Sie die Antworten
Stellen Sie jedem Anbieter alle neun Fragen, auch uns, und schreiben Sie die Antworten nebeneinander auf. Das Muster zählt mehr als jede einzelne Antwort: Anbieter, die liefern, antworten konkret, ein wenig langweilig und mit Zahlen. Anbieter, die vorführen, antworten selbstsicher und sprechen über Fähigkeiten. Wenn Sie diesen Vergleich in strukturierter Form suchen: Wir stellen die Abwägungen gegenüber klassischen Unternehmensberatungen und Automatisierungsagenturen dar, einschließlich der Fälle, in denen die jeweils andere Seite die bessere Wahl ist.



