Die meisten Anbieter schreiben diese Zahl nicht auf, also tun wir es: Ein produktiver KI-Agent kostet einen Pauschalpreis, ab 8.000 $ für einen Standard-Agenten und bis etwa 150.000 $ für ein komplexes Projekt mit hohen Anforderungen an die Zuverlässigkeit. Bis zum Live-Betrieb vergehen rund 90 Tage. Das sind unsere veröffentlichten Preise. Die Modellkosten, um die sich alle sorgen, sind dabei der kleinste Posten im ganzen Budget. Zehntausend Support-Gespräche mit einem schnellen Modell zu verarbeiten kostet rund 37 $ an Tokens (Preisliste von Anthropic). Das Geld fließt an ganz andere Stellen. Wer weiß, an welche, bekommt einen Agenten, der sich bezahlt macht, und keinen, der auf dem Friedhof der eingestellten KI-Projekte landet.
Denn der größte Teil der KI-Ausgaben bringt derzeit nichts ein. 95 % der Pilotprojekte mit generativer KI in Unternehmen haben keinen messbaren Effekt auf die Gewinn- und Verlustrechnung (MIT Project NANDA, 2025), und Gartner erwartet, dass mehr als 40 % der Projekte mit agentischer KI bis Ende 2027 eingestellt werden, vor allem wegen steigender Kosten und unklarem Nutzen (Gartner, 2025). Eingesetzt wird KI dabei fast überall: 91 % der von RSM befragten mittelständischen Unternehmen nutzen generative KI, aber nur 25 % haben sie in ihre Kernprozesse integriert (RSM, 2025). Der Abstand zwischen KI nutzen und mit KI Geld verdienen ist ein Engineering-Problem. Genau dort entstehen die eigentlichen Kosten.
Was kostet die Entwicklung eines KI-Agenten?
Ein produktiver KI-Agent, also ein Agent für einen wertvollen Workflow, in Ihrer Systemlandschaft in Betrieb genommen, mit Evals und Observability, kostet einen Pauschalpreis: ab 8.000 $ für einen Standard-Agenten und bis etwa 150.000 $ für die komplexesten Projekte. Die Umsetzung dauert etwa 90 Tage. Eine Analyse zum Festpreis, an deren Ende ein Pilot im Betrieb steht, kostet 25.000 $. Das sind unsere veröffentlichten Preise, und sie entsprechen dem, was ernsthafte Projekte im Mittelstand kosten.
Die Spanne von 8.000 $ bis 150.000 $ ist kein Polster. Vier Faktoren bestimmen, wo ein Projekt landet:
- Umfang der Integration. Ein Agent, der aus einem System liest und in ein anderes schreibt, markiert das untere Ende. Einer, der fünf Tools steuert und Freigaben durch Menschen einbindet, markiert das obere.
- Zustand der Daten. Liegt das Wissen, das der Agent braucht, in sauberen, abfragbaren Systemen, sparen Sie Wochen. Liegt es in Postfächern und PDFs, planen Sie Budget für die Datenpipeline ein. Schlechte Datenqualität ist das Hindernis, das Datenverantwortliche am häufigsten nennen, wenn Pilotprojekte in Produktion gehen sollen (Informatica CDO Insights, 2025).
- Risikoprofil. Ein Agent mit Kundenkontakt braucht Leitplanken, Evals und Eskalationswege, die ein internes Werkzeug nicht braucht.
- Anspruch an den Betrieb. „Funktioniert in der Demo“ und „läuft nachts um zwei unbeaufsichtigt“ sind zwei verschiedene Produkte.
Was kostet der laufende Betrieb?
Weniger, als Sie vermuten. Bei einem typischen Workflow im Mittelstand kostet die Inferenz meist Cent pro Vorgang, nicht Dollar. Die aktuell veröffentlichten API-Preise der großen Modellanbieter je eine Million Tokens:
| Modellklasse | Input / 1 Mio. Tokens | Output / 1 Mio. Tokens |
|---|---|---|
| Claude Haiku 4.5 (hohes Volumen) | 1 $ | 5 $ |
| Gemini 2.5 Pro | 1,25 $ | 10 $ |
| GPT-5.6 (Flaggschiff) | 2,50 $ | 15 $ |
| Claude Sonnet 5 (Standard für Produktion) | 3 $ | 15 $ |
Quellen: Preisseiten von Anthropic, Google und OpenAI, 2026. Bei rund 3.700 Tokens pro Gespräch kostet die Verarbeitung von 10.000 Support-Tickets mit Haiku etwa 37 $ (Anthropic). Zwei eingebaute Hebel senken den Betrag weiter: Prompt-Caching reduziert den Preis für wiederholt gelesenen Kontext auf ein Zehntel, Batch-Verarbeitung halbiert ihn.
Dieser Posten wird außerdem rapide billiger. Nach unabhängiger Messung ist der Preis für ein bestimmtes Leistungsniveau um etwa den Faktor 40 pro Jahr gesunken (Epoch AI, 2025). Was Inferenz heute kostet, kostet sie im nächsten Quartal weniger. Deshalb ist es ein Fehler, das Budget für einen Agenten an den Token-Kosten auszurichten: Dauerhaft kosten das Engineering, die Integration und der Betrieb rund um das Modell, nicht der Modellaufruf.
Nach dem Start verändern sich Modelle schleichend, Anbieter liefern Änderungen aus, die Bestehendes brechen, und Sonderfälle sammeln sich an. Ein Agent ohne betreuten Betrieb wird unbemerkt schlechter, bis jemandem ein Monat fehlerhafter Ergebnisse auffällt. Planen Sie die laufende Pauschale von 3.000–20.000 $ pro Monat so ein wie das Hosting einer Software: als Kosten dafür, das System zu besitzen, nicht als optionales Extra.
Wo Teams tatsächlich zu viel ausgeben
Nicht bei den Tokens, sondern bei gescheiterten Projekten. Wenn 95 % der Pilotprojekte nichts einbringen (MIT, 2025) und über 40 % der agentischen Projekte eingestellt werden (Gartner, 2025), dann ist der größte Kostenblock im Markt das Geld für KI, die nie in Produktion angekommen ist. Dieselbe MIT-Studie zeigt auch das Muster, das davor schützt: Wer bei spezialisierten Anbietern einkaufte oder mit ihnen zusammenarbeitete, war in etwa 67 % der Fälle erfolgreich. Interne Eigenentwicklungen gelangen nur etwa ein Drittel so oft. Teuer wird der Weg über eine Lösung auf Demo-Niveau, die unter echter Last zusammenbricht und neu gebaut werden muss. Dann zahlen Sie zweimal. Die Engineering-Sicht darauf steht in unserem Artikel Warum KI-Pilotprojekte nicht in Produktion gehen.
Lohnt sich ein KI-Agent für ein mittelständisches Unternehmen?
Wenn ein Workflow jede Woche 15 oder mehr bezahlte Arbeitsstunden bindet, meistens ja. Rechnen Sie es aber durch, bevor Sie sich festlegen. Unser KI-ROI-Rechner (Englisch) macht aus Wochenstunden und Vollkosten eine Spanne für die jährliche Einsparung und eine Amortisationszeit. Ein Workflow, der 20 Stunden pro Woche zu 75 $ pro Stunde bindet, kostet rund 78.000 $ im Jahr. Lassen sich 50–70 % davon automatisieren, hat sich ein Agent für 90.000 $ in weniger als zwei Jahren bezahlt gemacht. Zur Einordnung: IDC beziffert den durchschnittlichen Ertrag von Unternehmen auf 3,70 $ je investiertem Dollar in generative KI. Das ist allerdings eine von Microsoft finanzierte Studie. Lesen Sie die Zahl als optimistische Obergrenze, nicht als Untergrenze.
So halten Sie die Kosten niedrig
- Auf einen Workflow begrenzen. Kosten und Ausfallrisiko wachsen beide mit dem Umfang. Ein Agent für einen Workflow, der wirklich wehtut, in Produktion. Danach erweitern Sie.
- Das Modell passend zur Aufgabe wählen. Die meisten Schritte brauchen kein Flaggschiff-Modell. Eine günstigere Klasse erledigt Klassifikation und Extraktion in großem Volumen für einen Bruchteil des Preises (siehe Tabelle oben).
- Das Muster einkaufen, das Besondere selbst bauen. Partnerschaften waren etwa doppelt so oft erfolgreich wie interne Eigenentwicklungen (MIT, 2025). Heben Sie sich individuelles Engineering für das auf, was Sie wirklich vom Wettbewerb unterscheidet.
- Evals zur Freigabebedingung machen. Eine Eval-Suite ist die günstigste Versicherung dagegen, zweimal zu zahlen. Sie erkennt Regressionen, bevor sie die Produktion erreichen. Wie wir Evals aufbauen, beschreibt dieser Artikel (Englisch).
- Zuerst das Risiko mit einer Analyse zum Festpreis senken. Ein zweiwöchiger Sprint liefert Ihnen die echte Zahl, bevor Sie sich festlegen. Sein Preis wird auf das Projekt angerechnet, das er spezifiziert.
Kurz gefasst: Die Token-Rechnung ist ein Rundungsfehler und wird noch kleiner. Die Entwicklung kostet echtes Geld. Und das gescheiterte Projekt ist das Teuerste, was Sie kaufen können. Investieren Sie in die Disziplin, die es verhindert. Wenn KI der Kern Ihres Produkts ist und Sie Senior-Engineers für KI einstellen können, ist die Eigenentwicklung langfristig die bessere Wahl. Das schreiben wir auch in unserem Vergleich Eigenentwicklung, Einkauf oder eingebettetes Team. In allen anderen Fällen ist ein produktiver Agent für den Workflow, der Sie heute Geld kostet, der richtige Schritt. Ob die Rechnung aufgeht, zeigt Ihnen der ROI-Rechner (Englisch), bevor Sie einen Dollar ausgeben.



